Bot'lar şu mantıkla çalışır;
Hedef siteye istek yapıp, kaynak kodunu almak -> Bu kaynak kod'dan istediğin kısmı almak -> Bu aldığın kısımları Veritabanına kayıt etmek.
Hedef siteden kaynak kodu almak: file_get_contents - eğer karşı sitede güvenlik önlemi, yönlendirme yoksa; basitçe içeriği bu fonksiyon ile alabilirsin
cURL - karşı sitede güvenlik önemli veya yönlendirme varsa; giriş yapman gerekiyorsa vs. cURL ile tarayıcıyla yaptığın işlemleri taklik edebilirsin.
cURL'u direk kullanmak yerine
Guzzle tarzı kütüphanelere de bakabilirsin.
Kaynak kodu parçalayıp, istediğin bölümü almak:
Bunun için
Regex kullanmalısın, php'de
şu fonksiyonlar ile Regex ifadelerini kullanabilirsin.
Genelde HTML sayfalardan içerik çekeceğin için, direk DOM Parser yazılımları kullanabilirsin, işini kolaylaştırır.
http://simplehtmldom.sourceforge.net/ https://github.com/paquettg/php-html-parser http://stackoverflow.com/questions/3...tml-xml-in-php - burda farklı veri tiplerini parçalamak için kullanabileceğin kütüphaneler verilmiş
bazılarında veriyi çekme özelliğide var, yani ilk kısmı sağlıyor direk olarak
Aldığın bilgileri veritabanına kayıt etme:
Burda normal bir SQL sorgusuyla insert yapacaksın sitenin Veritabanı yapısına göre.
WordPress kullanıyorsan,
şu fonksiyonla da ekleme yapabilirsin