DevOps & Altyapı
vLLM Rehberi: PagedAttention ile Açık Kaynak Modelleri Üretimde Sunma
Açık kaynak LLM'leri (DeepSeek, Llama, Qwen) PagedAttention ve dinamik batching ile yüksek throughput ve düşük VRAM kullanımıyla sunma rehberi.
PagedAttention Teknolojisi Nedir?
Geleneksel çıkarım motorlarında KV Cache belleği ardışık ayrıldığı için VRAM'in %60-80'i boşa harcanır.
vLLM, işletim sistemlerindeki sanal bellek (paging) mantığını KV Cache'e uygulayarak eşzamanlı istek kapasitesini 5 katına çıkarır.
# vLLM ile OpenAI uyumlu sunucu başlatma
python3 -m vllm.entrypoints.openai.api_server \
--model deepseek-ai/DeepSeek-R1-Distill-Qwen-14B \
--tensor-parallel-size 2 \
--gpu-memory-utilization 0.90 \
--port 8000Sıkça Sorulan Sorular
vLLM OpenAI istemcileriyle uyumlu mu?
Evet, vLLM /v1/chat/completions endpoint'i sunduğu için mevcut kodunuzda sadece baseURL değiştirerek doğrudan kullanabilirsiniz.
İlgili Teknik Rehberler
Bu mimariyle bağlantılı diğer üretim odaklı rehber ve vaka analizlerini inceleyin:
FastAPI ve Docker: Gunicorn Uvicorn Workerları ile Production Dağıtım Mimarisi
FastAPI uygulamalarını multi-stage Dockerfile, non-root kullanıcı ve Gunicorn worker process yöneticisi ile güvenli ve ölçeklenebilir şekilde sunucuya alma.
FastAPI ve OpenTelemetry: Dağıtık İzleme (Tracing), Prometheus Metrikleri ve Grafana
API gecikmelerini ve SQL darboğazlarını milisaniyelik hassasiyetle tespit etmek için OpenTelemetry, Prometheus ve Grafana entegrasyonu.
Next.js Edge Runtime: Vercel Edge Middleware ve Düşük Gecikmeli Coğrafi Dağıtım
Node.js cold-start sürelerini sıfıra indiren ve dünyanın dört bir yanındaki edge lokasyonlarında çalışan V8 tabanlı Edge Runtime mimarisi.