DevOps & Altyapı
vLLM Rehberi: PagedAttention ile Açık Kaynak Modelleri Üretimde Sunma
Açık kaynak LLM'leri (DeepSeek, Llama, Qwen) PagedAttention ve dinamik batching ile yüksek throughput ve düşük VRAM kullanımıyla sunma rehberi.
3 dk
PagedAttention Teknolojisi Nedir?
Geleneksel çıkarım motorlarında KV Cache belleği ardışık ayrıldığı için VRAM'in %60-80'i boşa harcanır.
vLLM, işletim sistemlerindeki sanal bellek (paging) mantığını KV Cache'e uygulayarak eşzamanlı istek kapasitesini 5 katına çıkarır.
vllm_server.sh
# vLLM ile OpenAI uyumlu sunucu başlatma
python3 -m vllm.entrypoints.openai.api_server \
--model deepseek-ai/DeepSeek-R1-Distill-Qwen-14B \
--tensor-parallel-size 2 \
--gpu-memory-utilization 0.90 \
--port 8000Sıkça Sorulan Sorular
vLLM OpenAI istemcileriyle uyumlu mu?
Evet, vLLM /v1/chat/completions endpoint'i sunduğu için mevcut kodunuzda sadece baseURL değiştirerek doğrudan kullanabilirsiniz.