Veri & Altyapı
RAG Chunking Stratejileri: Semantik, Recursive ve Belge Tabanlı Parçalama
Sabit karakterli bölmeler yerine başlık hiyerarşisi, Markdown yapısı ve anlamsal cümle kayması (semantic chunking) ile parçalama rehberi.
Chunk Boyutu ve Örtüşme (Chunk Overlap)
Çok küçük parçalar (100 token) bağlamı kaybeder; çok büyük parçalar (2000 token) gereksiz gürültü taşır. İdeal başlangıç noktası 512 token boyut ve %10-15 örtüşmedir (overlap).
İlgili Teknik Rehberler
Bu mimariyle bağlantılı diğer üretim odaklı rehber ve vaka analizlerini inceleyin:
Kazınan Veriyi PostgreSQL ve Supabase'e Aktarma: Güvenilir Data Pipeline Mimarisi
Toplanan ham verileri Pydantic ile doğrulama, tekrar eden kayıtları (deduplication) ayıklama ve toplu (batch) upsert ile veritabanına aktarma.
Supabase pgvector Rehberi: PostgreSQL ile Vektör Arama ve Benzerlik Sorguları
Ayrı bir vektör veritabanı satın almadan PostgreSQL ve pgvector eklentisi ile HNSW indeksleri ve kosinüs benzerliği (cosine distance) sorgulama rehberi.
Hibrit Arama (Hybrid Search): BM25 Anahtar Kelime ve Semantik Vektör Aramasını Birleştirme
Vektör aramasının kısaltmalar ve tam eşleşmelerdeki (Örn: Hata kodları, ürün SKU) zayıflıklarını BM25 anahtar kelime araması ve RRF ile çözme mimarisi.