Bot'lar şu mantıkla çalışır;

Hedef siteye istek yapıp, kaynak kodunu almak -> Bu kaynak kod'dan istediğin kısmı almak -> Bu aldığın kısımları Veritabanına kayıt etmek.


Hedef siteden kaynak kodu almak:
file_get_contents - eğer karşı sitede güvenlik önlemi, yönlendirme yoksa; basitçe içeriği bu fonksiyon ile alabilirsin
cURL - karşı sitede güvenlik önemli veya yönlendirme varsa; giriş yapman gerekiyorsa vs. cURL ile tarayıcıyla yaptığın işlemleri taklik edebilirsin.

cURL'u direk kullanmak yerine Guzzle tarzı kütüphanelere de bakabilirsin.

Kaynak kodu parçalayıp, istediğin bölümü almak:

Bunun için Regex kullanmalısın, php'de şu fonksiyonlar ile Regex ifadelerini kullanabilirsin.

Genelde HTML sayfalardan içerik çekeceğin için, direk DOM Parser yazılımları kullanabilirsin, işini kolaylaştırır.

http://simplehtmldom.sourceforge.net/
https://github.com/paquettg/php-html-parser
http://stackoverflow.com/questions/3...tml-xml-in-php - burda farklı veri tiplerini parçalamak için kullanabileceğin kütüphaneler verilmiş

bazılarında veriyi çekme özelliğide var, yani ilk kısmı sağlıyor direk olarak

Aldığın bilgileri veritabanına kayıt etme:
Burda normal bir SQL sorgusuyla insert yapacaksın sitenin Veritabanı yapısına göre.

WordPress kullanıyorsan, şu fonksiyonla da ekleme yapabilirsin