Tüm notlar
·2 dk okuma·
  • crawl4ai
  • web-scraping
  • python
  • otomasyon
  • yapay-zeka
  • llm
  • haber-ozeti
  • acik-kaynak

40 Satır Python ile Kendi Haber Ajansını Kur: Crawl4AI Rehberi

Crawl4AI ile 5 web sitesini paralel çekip LLM ile özetleyen kişisel haber bülteni nasıl kurulur? Anti-bot sorunlarına gerçek çözüm.

Instagram'da izle
40 Satır Python ile Kendi Haber Ajansını Kur: Crawl4AI Rehberi

Her gün takip ettiğin onlarca site var; teknoloji haberleri, sektör gündemleri, yatırım yaptığın şirketin duyuruları. Hepsine tek tek girmek yerine sabah gelen derli toplu bir e-posta bülteni hayal ettiysen, Crawl4AI tam bu iş için yapılmış bir araç.

Crawl4AI Nedir?

Crawl4AI, web sitelerini asenkron olarak tarayan ve çektiği içeriği temiz Markdown formatına dönüştüren açık kaynaklı bir Python kütüphanesidir. GitHub'da 40.000'den fazla yıldıza sahip olan proje; cache yönetimi, derin tarama (deep crawl) ve LLM'e hazır içerik çıkarımı gibi özellikleri kutudan çıkar çıkmaz sunuyor.

Temel akış şu şekilde çalışıyor:

  1. Crawl4AI → 5 kaynağı paralel ve asenkron çeker
  2. Temiz Markdown → Gerçek makale linkleriyle birlikte çıktı üretir
  3. LLM katmanı → Önemli haberleri seçer ve özetler
  4. HTML bülten → İstediğin saatte e-posta olarak render edilir

Neden Sadece LLM Yetmiyor?

Projeyi denerken önce Claude'un kendi Playwright özelliğini kullandım. Bazı siteleri doğrudan fetch edebildi; ancak bot koruması olan sitelerde takıldı. Bir sitede yalnızca konu başlıklarını alabiliyor, içeriğe ulaşamıyordu. İçerik olmayınca LLM'in özeti kaçınılmaz olarak yüzeysel kalıyor, hatta içerik üretme (hallüsinasyon) riski doğuyor.

Crawl4AI'ı devreye aldığımda fark çok netti: Headless Chromium kullandığı için anti-bot mekanizmalarına takılmadan 5/5 siteyi saniyeler içinde çekti. Markdown çıktısı başlıkları, açıklamaları ve linkleri eksiksiz içeriyordu. "Git bak, ben çektim" gibi bir belirsizlik yoktu; temiz ve doğrulanabilir veri.

Projeyi Nasıl Kurarsın?

Yorumlardan en çok gelen soru kurulum olduğu için adımları net koymak gerekiyor:

pip install crawl4ai
crawl4ai-setup  # Headless Chromium ve bağımlılıkları indirir

Kurulum tamamlandıktan sonra takip etmek istediğin sitelerin URL'lerini bir listeye ekliyor, asenkron crawler'ı çalıştırıyor ve çıkan Markdown'ı LLM'e besliyorsun. LLM; önemli haberleri seçiyor, kısa özetler yazıyor ve sonucu HTML bülten olarak döndürüyor. Tüm bu akışı 40 satır civarında Python koduyla kurabilirsin.

E-posta Entegrasyonu

Şu an için sisteme bir e-posta servisi bağlı değil; bu kasıtlı olarak sade tutulmuş bir başlangıç noktası. Mailgun, SendGrid veya basit bir SMTP bağlantısıyla istediğin saatte otomatik bülten gönderimini ekleyebilirsin. Örneğin her gün saat 06:00'da haber özetlerini almak için bir cron job yeterli.

Sadece Haber Takibi Değil

Bu sistemi yalnızca teknoloji haberleriyle sınırlı düşünme. Yatırım yaptığın bir şirketin IR sayfasını, takip ettiğin bir araştırma grubunun yayınlarını veya rakip ürünlerin changelog'larını da aynı pipeline'dan geçirebilirsin. Belirli bir konuyu düzenli izlemen gereken her senaryo için işe yarıyor.

Sonuç

Hazır LLM araçları birçok görevi yerine getirebiliyor; ancak web'den temiz ve güvenilir veri çekmek söz konusu olduğunda özelleşmiş bir crawler ciddi fark yaratıyor. Crawl4AI'ı denemeden "zaten cloud yapıyor" diye geçiştirmek, hem daha hızlı hem de hallüsinasyonsuz sonuçlara ulaşma şansını kaçırmak demek. Repoya bir şans ver, hafta sonu 40 satırla kendi bültenini kur.