AI Altyapısı
DeepSeek-R1 ve Açık Kaynak Reasoning Modellerini Yerelde Çalıştırma (Ollama & vLLM)
DeepSeek-R1 ve damıtılmış (distilled) açık kaynak akıl yürütme modellerini kendi sunucunuzda vLLM veya Ollama ile sıfır API maliyeti ve tam veri gizliliğiyle nasıl çalıştıracağınızı öğrenin.
Özet & Doğrudan Çözüm (TL;DR)
DeepSeek-R1, denetimli ince ayar (supervised fine-tuning) olmadan doğrudan pekiştirmeli öğrenme (pure RL ve GRPO - Group Relative Policy Optimization) ile eğitilen ve kapalı kaynak reasoning modellerine açık ağırlıklı (open-weights) bir alternatif sunan devrim niteliğinde bir akıl yürütme modelidir. Damıtılmış modelleri (14B ve 32B) vLLM veya Ollama ile yerel kurumsal sunucularda veya geliştirici iş istasyonlarında sıfır API faturası ve %100 veri egemenliğiyle çalıştırılabilir.
Önemli Çıkarımlar:
- GRPO Algoritması: Eleştirmen (critic) modeli gerektirmeyen grup göreceli politika optimizasyonu sayesinde devasa hesaplama tasarrufu.
- Damıtılmış (Distilled) Ağırlıklar: Qwen ve Llama tabanlı 14B ve 32B modeller tek bir tüketici GPU'sunda (RTX 4090) mükemmel akıl yürütme performansı sunar.
- <think> Belirteç Mimarisi: Modelin iç akıl yürütme adımlarını şeffafça denetleme ve son kullanıcıya vermeden önce filtreleme imkanı.
- Tam Veri Gizliliği: Finans, sağlık ve hassas kamu verilerinin buluta çıkmadan hava boşluklu (air-gapped) ortamlarda işlenmesi.
1. Açık Kaynak Akıl Yürütme Devrimi: GRPO Nedir?
Geleneksel RLHF (Reinforcement Learning from Human Feedback) süreçleri, ödül hesaplamak için ana model boyutunda ayrı bir 'Critic' (eleştirmen) modeline ihtiyaç duyar ve bu durum GPU bellek ihtiyacını ikiye katlar.
DeepSeek-R1 ile hayatımıza giren GRPO (Group Relative Policy Optimization) mimarisi ise her soru için modelden bir grup yanıt üretir, bu yanıtları grup içi göreli başarı puanına göre sıralar ve eleştirmen modeline ihtiyaç duymadan politikayı günceller. Bu yöntem modelin kendiliğinden <think> etiketleri açarak akıl yürütmesini ve strateji geliştirmesini sağlamıştır.
2. Ollama ve vLLM ile Kurumsal Dağıtım
Geliştirici ortamında hızlı prototipleme için Ollama; yüksek eşzamanlı üretim ortamları için ise PagedAttention mimarisine sahip vLLM tercih edilir:
# Geliştirici makinesinde Ollama ile 14B modelini ayağa kaldırma
ollama run deepseek-r1:14b
# Üretim sunucusunda vLLM ile OpenAI uyumlu yüksek throughput servisi başlatma
python3 -m vllm.entrypoints.openai.api_server \
--model deepseek-ai/DeepSeek-R1-Distill-Qwen-14B \
--tensor-parallel-size 1 \
--gpu-memory-utilization 0.90 \
--max-model-len 16384 \
--port 80003. Donanım Gereksinimleri ve VRAM Hesaplama Matrisi
Model boyutuna ve kuantizasyon (AWQ, GGUF, FP8) türüne göre gereken minimum GPU belleği:
• DeepSeek-R1-Distill-Qwen-7B (Q4): ~6 GB VRAM — Giriş seviyesi GPU'lar veya Apple Silicon Mac'ler.
• DeepSeek-R1-Distill-Qwen-14B (Q4/FP8): ~10-14 GB VRAM — RTX 3060/4070 veya tek RTX 4080.
• DeepSeek-R1-Distill-Qwen-32B (Q4): ~20-24 GB VRAM — Tek bir NVIDIA RTX 4090 veya RTX 3090.
• DeepSeek-R1 Tam Model (671B MoE): 8x A100/H100 GPU kümesi gerektirir.
Sıkça Sorulan Sorular
Modelin ürettiği <think> blokları son kullanıcıdan nasıl gizlenir?
vLLM veya FastAPI middleware katmanında basit bir regex filtresi veya streaming buffer denetleyicisi ile akıl yürütme belirteçleri istemciye gönderilmeden temizlenir.
Damıtılmış 14B model kodlama için yeterli midir?
Evet. Qwen-14B tabanlı damıtılmış model, bağımsız HumanEval ve MATH kıyaslamalarında GPT-4o seviyesinde mantıksal doğruluk sergileyerek çoğu kurumsal backend ve algoritma görevi için fazlasıyla yeterlidir.
Doğrulanmış Kaynaklar ve Dokümantasyon
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning (arXiv:2501.12948)Resmi Doküman
- vLLM Production High-Throughput Inference EngineResmi Doküman
- Ollama Model Hub & Local RunnerResmi Doküman
İlgili Teknik Rehberler
Bu mimariyle bağlantılı diğer üretim odaklı rehber ve vaka analizlerini inceleyin:
Llama 4 MoE ve DeepSeek-R1: 24GB GPU Donanım Sınırları, vLLM PagedAttention ve think Filtreleme
DeepSeek-R1 damıtılmış modelleri, Meta Llama 4 Scout/Maverick MoE mimarisi, tek 24GB GPU (RTX 4090/A5000) donanım matrisi ve vLLM dağıtımı.
LiteLLM ile 100+ LLM Modelini Tek Bir OpenAI Uyumlu Proxy ile Yönetme
OpenAI, Anthropic, Gemini, Bedrock ve yerel modelleri tek bir standart API formatında birleştiren, otomatik fallback ve rate-limit yönetimi sunan LiteLLM rehberi.
LLM Evals: Üretimdeki AI Çıktılarını Otomatik Değerlendirme ve Skorlama
Prompt değişikliklerinin kaliteyi bozup bozmadığını anlamak için Ragas, DeepEval ve sentetik veri setleriyle otomatik LLM test süreçleri kurma.