Web Scraping

Crawl4AI Rehberi: LLM ve RAG Sistemleri İçin Temiz Markdown ve JSON Kazıma

Açık kaynak Crawl4AI kütüphanesi ile web sayfalarını HTML çöplerinden arındırıp LLM dostu temiz Markdown ve yapılandırılmış JSON formatında kazıma rehberi.

3 dk

Özet & Doğrudan Çözüm (TL;DR)

Crawl4AI, büyük dil modelleri (LLM) ve RAG boru hatları için geliştirilmiş açık kaynaklı asenkron bir web kazıma motorudur. Ham HTML içindeki reklam, menü ve CSS gürültüsünü filtreleyerek token kullanımını %70'e kadar azaltır ve Playwright tabanlı headless tarayıcı desteğiyle dinamik JavaScript sayfalarından doğrudan saf Markdown ve yapılandırılmış JSON çıktısı üretir.

Önemli Çıkarımlar:

  • Fit-Markdown Algoritması: Sayfa gürültüsünü temizleyerek LLM token tüketimini ve gecikme süresini minimize eder.
  • Asenkron & Yüksek Hızlı: Saniyede onlarca URL'yi eşzamanlı olarak tarayabilen asenkron Python mimarisi sunar.
  • Yerleşik LLM Çıkarımı: OpenAI, Gemini veya yerel Ollama modelleriyle entegre olarak semantik JSON şeması çıkarabilir.

Crawl4AI Neden Standart Scraper'lardan Farklıdır?

Geleneksel web kazıma araçları ham HTML döner. Bir LLM'e 50.000 satırlık karmaşık bir DOM ağacını vermek token bütçesini tüketir.

Crawl4AI; menüleri, reklamları, script etiketlerini ve CSS çöplerini otomatik temizler ve fit-markdown algoritmasıyla sadece ana içeriği saf Markdown olarak çıkarır.

crawl_example.py
import asyncio
from crawl4ai import AsyncWebCrawler

async def main():
    async with AsyncWebCrawler(verbose=True) as crawler:
        result = await crawler.arun(url="https://news.ycombinator.com")
        print("Temiz Markdown Çıktısı:")
        print(result.markdown[:500])

asyncio.run(main())

Sıkça Sorulan Sorular

Crawl4AI JavaScript render desteğine sahip mi?

Evet, arka planda Playwright motoru kullanarak SPA (React, Vue) sitelerini tam render edip kazıyabilir.

Doğrulanmış Kaynaklar ve Dokümantasyon