AI Altyapısı

DeepSeek-R1 ve Açık Kaynak Reasoning Modellerini Yerelde Çalıştırma (Ollama & vLLM)

DeepSeek-R1 ve damıtılmış (distilled) açık kaynak akıl yürütme modellerini kendi sunucunuzda vLLM veya Ollama ile sıfır API maliyeti ve tam veri gizliliğiyle nasıl çalıştıracağınızı öğrenin.

Güncellendi: 9 Eylül 20265 dk
Paylaş:XLinkedIn

Özet & Doğrudan Çözüm (TL;DR)

DeepSeek-R1, denetimli ince ayar (supervised fine-tuning) olmadan doğrudan pekiştirmeli öğrenme (pure RL ve GRPO - Group Relative Policy Optimization) ile eğitilen ve kapalı kaynak reasoning modellerine açık ağırlıklı (open-weights) bir alternatif sunan devrim niteliğinde bir akıl yürütme modelidir. Damıtılmış modelleri (14B ve 32B) vLLM veya Ollama ile yerel kurumsal sunucularda veya geliştirici iş istasyonlarında sıfır API faturası ve %100 veri egemenliğiyle çalıştırılabilir.

Önemli Çıkarımlar:

  • GRPO Algoritması: Eleştirmen (critic) modeli gerektirmeyen grup göreceli politika optimizasyonu sayesinde devasa hesaplama tasarrufu.
  • Damıtılmış (Distilled) Ağırlıklar: Qwen ve Llama tabanlı 14B ve 32B modeller tek bir tüketici GPU'sunda (RTX 4090) mükemmel akıl yürütme performansı sunar.
  • <think> Belirteç Mimarisi: Modelin iç akıl yürütme adımlarını şeffafça denetleme ve son kullanıcıya vermeden önce filtreleme imkanı.
  • Tam Veri Gizliliği: Finans, sağlık ve hassas kamu verilerinin buluta çıkmadan hava boşluklu (air-gapped) ortamlarda işlenmesi.

1. Açık Kaynak Akıl Yürütme Devrimi: GRPO Nedir?

Geleneksel RLHF (Reinforcement Learning from Human Feedback) süreçleri, ödül hesaplamak için ana model boyutunda ayrı bir 'Critic' (eleştirmen) modeline ihtiyaç duyar ve bu durum GPU bellek ihtiyacını ikiye katlar.

DeepSeek-R1 ile hayatımıza giren GRPO (Group Relative Policy Optimization) mimarisi ise her soru için modelden bir grup yanıt üretir, bu yanıtları grup içi göreli başarı puanına göre sıralar ve eleştirmen modeline ihtiyaç duymadan politikayı günceller. Bu yöntem modelin kendiliğinden <think> etiketleri açarak akıl yürütmesini ve strateji geliştirmesini sağlamıştır.

2. Ollama ve vLLM ile Kurumsal Dağıtım

Geliştirici ortamında hızlı prototipleme için Ollama; yüksek eşzamanlı üretim ortamları için ise PagedAttention mimarisine sahip vLLM tercih edilir:

deploy_deepseek.sh
# Geliştirici makinesinde Ollama ile 14B modelini ayağa kaldırma
ollama run deepseek-r1:14b

# Üretim sunucusunda vLLM ile OpenAI uyumlu yüksek throughput servisi başlatma
python3 -m vllm.entrypoints.openai.api_server \
  --model deepseek-ai/DeepSeek-R1-Distill-Qwen-14B \
  --tensor-parallel-size 1 \
  --gpu-memory-utilization 0.90 \
  --max-model-len 16384 \
  --port 8000

3. Donanım Gereksinimleri ve VRAM Hesaplama Matrisi

Model boyutuna ve kuantizasyon (AWQ, GGUF, FP8) türüne göre gereken minimum GPU belleği:

• DeepSeek-R1-Distill-Qwen-7B (Q4): ~6 GB VRAM — Giriş seviyesi GPU'lar veya Apple Silicon Mac'ler.

• DeepSeek-R1-Distill-Qwen-14B (Q4/FP8): ~10-14 GB VRAM — RTX 3060/4070 veya tek RTX 4080.

• DeepSeek-R1-Distill-Qwen-32B (Q4): ~20-24 GB VRAM — Tek bir NVIDIA RTX 4090 veya RTX 3090.

• DeepSeek-R1 Tam Model (671B MoE): 8x A100/H100 GPU kümesi gerektirir.

Sıkça Sorulan Sorular

Modelin ürettiği <think> blokları son kullanıcıdan nasıl gizlenir?

vLLM veya FastAPI middleware katmanında basit bir regex filtresi veya streaming buffer denetleyicisi ile akıl yürütme belirteçleri istemciye gönderilmeden temizlenir.

Damıtılmış 14B model kodlama için yeterli midir?

Evet. Qwen-14B tabanlı damıtılmış model, bağımsız HumanEval ve MATH kıyaslamalarında GPT-4o seviyesinde mantıksal doğruluk sergileyerek çoğu kurumsal backend ve algoritma görevi için fazlasıyla yeterlidir.

Doğrulanmış Kaynaklar ve Dokümantasyon

  • DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning (arXiv:2501.12948)Resmi Doküman
  • vLLM Production High-Throughput Inference EngineResmi Doküman
  • Ollama Model Hub & Local RunnerResmi Doküman

İlgili Teknik Rehberler

Bu mimariyle bağlantılı diğer üretim odaklı rehber ve vaka analizlerini inceleyin: