Proje Özeti:
Belirttiğimiz domain/URL listelerini günlük olarak batch halinde tarayıp (crawl), sayfa içeriğini, statik kaynakları (CSS/JS/resim) ve HTTP başlıklarını arşivleyecek bir sistem istiyoruz. Sistem; geçmişe dönük snapshotları saklayıp istenen
tarih ve saatteki hâli yeniden gösterebilmeli.
Temel Beklenti / Gereksinimler- Günlük ortalama 500 URL (veya site) tarama kapasitesi (ölçeklenebilir tasarım).
- Her URL için: HTML içeriği, HTTP durum kodu, başlıklar, temel statik dosya yollarının kaydı.
- Snapshot / replay: Verilen bir tarih/saat için sayfanın o anki hâlini render edebilecek (basit HTML replay veya headless-rendered görüntü).
- Batch (zamanlanmış) görevler örn. cron veya queue tabanlı.
- Basit yönetici arayüzü veya API: domain/URL listesi yükleme, çekim geçmişi görüntüleme, snapshot isteği.
- Loglama, hata/işlem raporu, retry mekanizmaları.
- Depolama tercihi: S3/Blob veya yerel disk + meta DB (Postgres/MariaDB).
- Headless tarama opsiyonu (tercih: Puppeteer/Playwright) JS render gereken sayfalar için.
- İstek: hafif ve maliyet-dostu çalışan çözüm; gerektiğinde yatay ölçeklenebilir.
Tercih Edilen Teknolojiler (esnek)- Backend: Node.js / Python / Go / PHP (tercihe göre)
- Headless: Puppeteer / Playwright / Selenium
- Queue: RabbitMQ / Redis Queue / Beanstalkd
- DB: Postgres / MariaDB + object storage (S3 uyumlu)
- Basit UI: React / Vue veya admin panel
- Container: Docker (tercihen Kubernetes-ready)
Teslimat / Çıktılar- Çalışır bir crawl/archiving servisi (container veya deploy talimatı).
- API dokümantasyonu veya küçük yönetim UIsı.
- Basit deploy & run talimatları, çalıştırma örnekleri.
- Performans/kapasite raporu (günlük 500 URL testi sonuçları).
Teklif / İletişim
Süre ve fiyat için
DM atınız. Lütfen teklifte: tahmini süre, ücret, referans projeler, kullandığınız teknoloji yığını ve sunucu/host önerilerinizi belirtin.