DevOps & Altyapı

vLLM Rehberi: PagedAttention ile Açık Kaynak Modelleri Üretimde Sunma

Açık kaynak LLM'leri (DeepSeek, Llama, Qwen) PagedAttention ve dinamik batching ile yüksek throughput ve düşük VRAM kullanımıyla sunma rehberi.

3 dk

PagedAttention Teknolojisi Nedir?

Geleneksel çıkarım motorlarında KV Cache belleği ardışık ayrıldığı için VRAM'in %60-80'i boşa harcanır.

vLLM, işletim sistemlerindeki sanal bellek (paging) mantığını KV Cache'e uygulayarak eşzamanlı istek kapasitesini 5 katına çıkarır.

vllm_server.sh
# vLLM ile OpenAI uyumlu sunucu başlatma
python3 -m vllm.entrypoints.openai.api_server \
    --model deepseek-ai/DeepSeek-R1-Distill-Qwen-14B \
    --tensor-parallel-size 2 \
    --gpu-memory-utilization 0.90 \
    --port 8000

Sıkça Sorulan Sorular

vLLM OpenAI istemcileriyle uyumlu mu?

Evet, vLLM /v1/chat/completions endpoint'i sunduğu için mevcut kodunuzda sadece baseURL değiştirerek doğrudan kullanabilirsiniz.