Proje Özeti:
Belirttiğimiz domain/URL listelerini günlük olarak batch halinde tarayıp (crawl), sayfa içeriğini, statik kaynakları (CSS/JS/resim) ve HTTP başlıklarını arşivleyecek bir sistem istiyoruz. Sistem; geçmişe dönük snapshot’ları saklayıp istenen tarih ve saatteki hâli yeniden gösterebilmeli.
Temel Beklenti / Gereksinimler
  • Günlük ortalama 500 URL (veya site) tarama kapasitesi (ölçeklenebilir tasarım).
  • Her URL için: HTML içeriği, HTTP durum kodu, başlıklar, temel statik dosya yollarının kaydı.
  • Snapshot / replay: Verilen bir tarih/saat için sayfanın o anki hâlini render edebilecek (basit HTML replay veya headless-rendered görüntü).
  • Batch (zamanlanmış) görevler — örn. cron veya queue tabanlı.
  • Basit yönetici arayüzü veya API: domain/URL listesi yükleme, çekim geçmişi görüntüleme, snapshot isteği.
  • Loglama, hata/işlem raporu, retry mekanizmaları.
  • Depolama tercihi: S3/Blob veya yerel disk + meta DB (Postgres/MariaDB).
  • Headless tarama opsiyonu (tercih: Puppeteer/Playwright) — JS render gereken sayfalar için.
  • İstek: hafif ve maliyet-dostu çalışan çözüm; gerektiğinde yatay ölçeklenebilir.
Tercih Edilen Teknolojiler (esnek)
  • Backend: Node.js / Python / Go / PHP (tercihe göre)
  • Headless: Puppeteer / Playwright / Selenium
  • Queue: RabbitMQ / Redis Queue / Beanstalkd
  • DB: Postgres / MariaDB + object storage (S3 uyumlu)
  • Basit UI: React / Vue veya admin panel
  • Container: Docker (tercihen Kubernetes-ready)
Teslimat / Çıktılar
  1. Çalışır bir crawl/archiving servisi (container veya deploy talimatı).
  2. API dokümantasyonu veya küçük yönetim UI’sı.
  3. Basit deploy & run talimatları, çalıştırma örnekleri.
  4. Performans/kapasite raporu (günlük 500 URL testi sonuçları).
Teklif / İletişim
Süre ve fiyat için DM atınız. Lütfen teklifte: tahmini süre, ücret, referans projeler, kullandığınız teknoloji yığını ve sunucu/host önerilerinizi belirtin.