Web Scraping
Crawl4AI Rehberi: LLM ve RAG Sistemleri İçin Temiz Markdown ve JSON Kazıma
Açık kaynak Crawl4AI kütüphanesi ile web sayfalarını HTML çöplerinden arındırıp LLM dostu temiz Markdown ve yapılandırılmış JSON formatında kazıma rehberi.
Özet & Doğrudan Çözüm (TL;DR)
Crawl4AI, büyük dil modelleri (LLM) ve RAG boru hatları için geliştirilmiş açık kaynaklı asenkron bir web kazıma motorudur. Ham HTML içindeki reklam, menü ve CSS gürültüsünü filtreleyerek token kullanımını %70'e kadar azaltır ve Playwright tabanlı headless tarayıcı desteğiyle dinamik JavaScript sayfalarından doğrudan saf Markdown ve yapılandırılmış JSON çıktısı üretir.
Önemli Çıkarımlar:
- Fit-Markdown Algoritması: Sayfa gürültüsünü temizleyerek LLM token tüketimini ve gecikme süresini minimize eder.
- Asenkron & Yüksek Hızlı: Saniyede onlarca URL'yi eşzamanlı olarak tarayabilen asenkron Python mimarisi sunar.
- Yerleşik LLM Çıkarımı: OpenAI, Gemini veya yerel Ollama modelleriyle entegre olarak semantik JSON şeması çıkarabilir.
Crawl4AI Neden Standart Scraper'lardan Farklıdır?
Geleneksel web kazıma araçları ham HTML döner. Bir LLM'e 50.000 satırlık karmaşık bir DOM ağacını vermek token bütçesini tüketir.
Crawl4AI; menüleri, reklamları, script etiketlerini ve CSS çöplerini otomatik temizler ve fit-markdown algoritmasıyla sadece ana içeriği saf Markdown olarak çıkarır.
import asyncio
from crawl4ai import AsyncWebCrawler
async def main():
async with AsyncWebCrawler(verbose=True) as crawler:
result = await crawler.arun(url="https://news.ycombinator.com")
print("Temiz Markdown Çıktısı:")
print(result.markdown[:500])
asyncio.run(main())Sıkça Sorulan Sorular
Crawl4AI JavaScript render desteğine sahip mi?
Evet, arka planda Playwright motoru kullanarak SPA (React, Vue) sitelerini tam render edip kazıyabilir.
Doğrulanmış Kaynaklar ve Dokümantasyon
- Crawl4AI GitHub Repository & Official DocumentationResmi Doküman
- Playwright Python DocumentationResmi Doküman
İlgili Teknik Rehberler
Bu mimariyle bağlantılı diğer üretim odaklı rehber ve vaka analizlerini inceleyin:
Playwright ve AI Vision ile Dinamik Web Kazıma ve Anti-Bot Korumalarını Aşma
Geleneksel CSS seçicilerinin kırıldığı dinamik sitelerde Playwright, LLM'ler ve Vision modelleriyle kendi kendine adapte olan akıllı scraping sistemleri.
Playwright Stealth ile Cloudflare ve DataDome Bot Korumalarını Aşma (2026)
Headless Chrome parmak izi (fingerprint) gizleme, TLS fingerprinting, WebGL/Canvas spoofing ve Cloudflare Challenge atlatma teknikleri.
Browserbase ve Headless Browser Cloud: Sunucusuz Web Kazıma ve Otomasyon
Yerel sunucularda Chromium bellek sızıntıları ve CPU yüküyle uğraşmadan, bulutta yönetilen binlerce headless tarayıcı oturumu çalıştırma mimarisi.