• 30-06-2014, 13:30:51
    #1
    Merhaba arkadaşlar, incir a.ş nin alt yapısını kullandığım bir e-ticaret sitem var, web yöneticisi araçlarında kayıtlı olan robots.txt dosyası aşağıda ki gibidir.

    User-agent: *
    Disallow: /

    User-agent: Googlebot
    Allow: /
    Crawl-Delay: 2

    User-agent: Yandex
    Allow: /
    Crawl-Delay: 2


    User-agent: Browsershots
    Allow: /


    User-agent: Googlebot
    Disallow: /images/thumbnails/
    Disallow: /skins/
    Disallow: /payments/
    Disallow: /store_closed.html
    Disallow: /core/
    Disallow: /lib/
    Disallow: /install/
    Disallow: /js/
    Disallow: /schemas/
    Disallow: /stores/
    Disallow: /addons/
    Disallow: /var/
    Disallow: /xml/
    Disallow: /shippings/
    Disallow: /stores/
    Disallow: /controllers/

    aslında ben bu robots.txt işinden fazla bir şey anlayamadığım için sizlerden yardım istiyorum.. Sanırım bu robots.txt dosyası siteye gelen google botlarının site içeriğinin indexlenmesiyle alakalı bir dosya, fakat yukarıda verdiğim kodlarda kendi edindiğim bilgilere göre (tamda emin değilim) bir terslik olduğunu düşünüyorum. Konuyla alakalı bilgiye sahip olan arkadaşların, yukarıdaki kodların ne anlama geldiğini yazarlarsa sevinirim.

    site adı: http://www.hadisendeal.com
    15 günlük site ve google indexi 5 gün önce 960 oldu ve 4 gündür 300 de
  • 30-06-2014, 18:22:36
    #2
    turkobil adlı üyeden alıntı: mesajı görüntüle
    Merhaba arkadaşlar, incir a.ş nin alt yapısını kullandığım bir e-ticaret sitem var, web yöneticisi araçlarında kayıtlı olan robots.txt dosyası aşağıda ki gibidir.

    User-agent: *
    Disallow: /

    User-agent: Googlebot
    Allow: /
    Crawl-Delay: 2

    User-agent: Yandex
    Allow: /
    Crawl-Delay: 2


    User-agent: Browsershots
    Allow: /


    User-agent: Googlebot
    Disallow: /images/thumbnails/
    Disallow: /skins/
    Disallow: /payments/
    Disallow: /store_closed.html
    Disallow: /core/
    Disallow: /lib/
    Disallow: /install/
    Disallow: /js/
    Disallow: /schemas/
    Disallow: /stores/
    Disallow: /addons/
    Disallow: /var/
    Disallow: /xml/
    Disallow: /shippings/
    Disallow: /stores/
    Disallow: /controllers/

    aslında ben bu robots.txt işinden fazla bir şey anlayamadığım için sizlerden yardım istiyorum.. Sanırım bu robots.txt dosyası siteye gelen google botlarının site içeriğinin indexlenmesiyle alakalı bir dosya, fakat yukarıda verdiğim kodlarda kendi edindiğim bilgilere göre (tamda emin değilim) bir terslik olduğunu düşünüyorum. Konuyla alakalı bilgiye sahip olan arkadaşların, yukarıdaki kodların ne anlama geldiğini yazarlarsa sevinirim.

    site adı: http://www.hadisendeal.com
    15 günlük site ve google indexi 5 gün önce 960 oldu ve 4 gündür 300 de
    Merhaba hocam, öncelikle kısaca robots dosyasından bahsedeyim, robots.txt rootta bulunan ve arama motoru örümceklerinin siteyi indexlemede yararlandıkları ilk yerdir diyebiliriz siz bu dosyanıza gireceğiniz bilgiler ile hangi örümceğin sitenizi indexleyeceğini ya da hangi sayfalarınızı indexlenmesi/indexlenmemesi gerektiğini bildirirsiniz.

    Google örümceklerinden bildiklerim;
    Alıntı
    Adsbot-Google
    Googlebot
    Mediapartners-Google
    googlebot-image
    googlebot-mobile
    Yandexin bazı örümcekleri;
    Alıntı
    Yandex
    YandexBot
    YandexImages
    YandexBlogs
    bunları robots.txt de tanımlarken şu şekilde kullanın, mesela google adsense botları için;

    Alıntı
    User-agent: Mediapartners-Google
    Disallow:
    Allow: /*
    dersek bu botlar sitemizdeki tüm sayfaları indexlesin demiş olduk, aynı zamanda disallow: boş bırakınca izin verilmeyen klasör yok dedik, bu bot sitenize sitenizin aldığı kaliteli backlinklerinde etkili olduğu belli sıklıkla her geldiğinde bu talimata uyar, tüm sayfalarınızda dolaşmaya başlar..

    User-agent: Bot adıdır, arama motoru örümceklerinin indexleme botları yada diğerlerinin.. * koyarsanız hepsine demiş olursunuz
    Allow: izin ver
    Allow: /* derseniz her şeye izin vermiş olursunuz
    Disallow: izin verme
    Disallow: / kullanırsanız yine indexleme demiş olursunuz, yani * kullanmak şart olmayabilir..
    Mesela Disallow: /skins/ derseniz siten.com/skins/ klasöründeki dosyaların sayfaların indexlenmesine izin vermemiş olursun bu noktada mesela sitenizdeki yazarların sayfalarını yada önemli sayfalarınızı istediğinize göre indexlenmemesi için kullanabilirsiniz.

    Örneğin robots.txt dosyanızda, tüm örümceklere indexlenmemesini istediğiniz klasörlerinizi belirtmek için;

    Alıntı
    User-Agent: *
    Disallow: /aklasörü/
    Disallow: /bklasörü/
    Disallow: /indexlenmesiniistemediğinklasör/
    eklersen tüm örümcekler bu sayfalarınızı indexlemez, bu kısma yanlış satırlar eklersen index kaybın olabilir aklında bulunsun

    mesela siz kullandığınız şu satırlarla
    Alıntı
    User-agent: *
    Disallow: /
    belirlediğiniz Googlebot, Yandex, Browsershots örümcekleri dışındaki tüm örümceklere sayfalarımı indexleme demişsiniz...

    şu kısımdaysa
    Alıntı
    User-agent: Googlebot
    Disallow: /images/thumbnails/
    Disallow: /skins/
    Disallo...
    googlebot için indexlenmemesini istediğiniz yerleri belirtmişsiniz..

    bunlar size sıkıntı çıkartabilir, düzenleyin derim.. Ek olarak robots.txt dosyanıza sitemap dosyanızıda eklemelisiniz gördüğüm kadarıyla eklememişsiniz..

    Alıntı
    şeklinde bir satır girmeniz gerekir ki örümcekler robots.txt dosyanıza uğradıklarında sitemapınıza kolayca ulaşıp sayfalarınızı indexleyebilsinler..

    Sonuç olarak şu şekilde düzenleyebilirsiniz robots.txt dosyanızı

    Alıntı
    User-agent: Mediapartners-Google
    Disallow:
    Allow: /*

    User-agent: Googlebot
    Disallow:
    Allow: /*

    User-agent: Adsbot-Google
    Disallow:
    Allow: /*

    User-agent: Yandex
    Disallow:
    Allow: /*

    User-agent: YandexBot
    Disallow:
    Allow: /*

    User-agent: YandexImages
    Disallow:
    Allow: /*

    User-agent: YandexBlogs
    Disallow:
    Allow: /*

    User-agent: googlebot-image
    Disallow:
    Allow: /*

    User-agent: googlebot-mobile
    Disallow:
    Allow: /*

    User-agent: msnbot
    Disallow:
    Allow: /*

    User-agent: bingbot
    Disallow:
    Allow: /*

    User-agent: Slurp
    Disallow:
    Allow: /*

    User-agent: Teoma
    Disallow:
    Allow: /*

    User-agent: twiceler
    Disallow:
    Allow: /*

    User-agent: Gigabot
    Disallow:
    Allow: /*

    User-agent: Scrubby
    Disallow:
    Allow: /*

    User-agent: Robozilla
    Disallow:
    Allow: /*

    User-agent: Nutch
    Disallow:
    Allow: /*

    User-agent: baiduspider
    Disallow:
    Allow: /*

    User-agent: naverbot
    Disallow:
    Allow: /*

    User-agent: yeti
    Disallow:
    Allow: /*

    User-agent: yahoo-mmcrawler
    Disallow:
    Allow: /*

    User-agent: psbot
    Disallow:
    Allow: /*

    User-agent: asterias
    Disallow:
    Allow: /*

    User-agent: yahoo-blogs/v3.9
    Disallow:
    Allow: /*

    User-agent: Browsershots
    Disallow:
    Allow: /*

    User-agent: duggmirror
    Disallow: /

    User-agent: HTTrack
    Disallow: /

    User-agent: grub-client
    Disallow: /

    User-agent: grub
    Disallow: /

    User-agent: looksmart
    Disallow: /

    User-agent: WebZip
    Disallow: /

    User-agent: larbin
    Disallow: /

    User-agent: b2w/0.1
    Disallow: /

    User-agent: psbot
    Disallow: /

    User-agent: Python-urllib
    Disallow: /

    User-agent: NetMechanic
    Disallow: /

    User-agent: URL_Spider_Pro
    Disallow: /

    User-agent: CherryPicker
    Disallow: /

    User-agent: EmailCollector
    Disallow: /

    User-agent: EmailSiphon
    Disallow: /

    User-agent: WebBandit
    Disallow: /

    User-agent: EmailWolf
    Disallow: /

    User-agent: ExtractorPro
    Disallow: /

    User-agent: CopyRightCheck
    Disallow: /

    User-agent: Crescent
    Disallow: /

    User-agent: SiteSnagger
    Disallow: /

    User-agent: ProWebWalker
    Disallow: /

    User-agent: CheeseBot
    Disallow: /

    User-agent: LNSpiderguy
    Disallow: /

    User-agent: Teleport
    Disallow: /

    User-agent: TeleportPro
    Disallow: /

    User-agent: MIIxpc
    Disallow: /

    User-agent: Telesoft
    Disallow: /

    User-agent: Website Quester
    Disallow: /

    User-agent: moget/2.1
    Disallow: /

    User-agent: WebZip/4.0
    Disallow: /

    User-agent: WebStripper
    Disallow: /

    User-agent: WebSauger
    Disallow: /

    User-agent: WebCopier
    Disallow: /

    User-agent: NetAnts
    Disallow: /

    User-agent: Mister PiX
    Disallow: /

    User-agent: WebAuto
    Disallow: /

    User-agent: TheNomad
    Disallow: /

    User-agent: WWW-Collector-E
    Disallow: /

    User-agent: RMA
    Disallow: /

    User-agent: libWeb/clsHTTP
    Disallow: /

    User-agent: asterias
    Disallow: /

    User-agent: httplib
    Disallow: /

    User-agent: turingos
    Disallow: /

    User-agent: spanner
    Disallow: /

    User-agent: InfoNaviRobot
    Disallow: /

    User-agent: Harvest/1.5
    Disallow: /

    User-agent: Bullseye/1.0
    Disallow: /

    User-agent: Mozilla/4.0 (compatible; BullsEye; Windows 95)
    Disallow: /

    User-agent: Crescent Internet ToolPak HTTP OLE Control v.1.0
    Disallow: /

    User-agent: CherryPickerSE/1.0
    Disallow: /

    User-agent: CherryPickerElite/1.0
    Disallow: /

    User-agent: WebBandit/3.50
    Disallow: /

    User-agent: NICErsPRO
    Disallow: /

    User-agent: Microsoft URL Control - 5.01.4511
    Disallow: /

    User-agent: DittoSpyder
    Disallow: /

    User-agent: Foobot
    Disallow: /

    User-agent: WebmasterWorldForumBot
    Disallow: /

    User-agent: SpankBot
    Disallow: /

    User-agent: BotALot
    Disallow: /

    User-agent: lwp-trivial/1.34
    Disallow: /

    User-agent: lwp-trivial
    Disallow: /

    User-agent: BunnySlippers
    Disallow: /

    User-agent: Microsoft URL Control - 6.00.8169
    Disallow: /

    User-agent: URLy Warning
    Disallow: /

    User-agent: Wget/1.6
    Disallow: /

    User-agent: Wget/1.5.3
    Disallow: /

    User-agent: Wget
    Disallow: /

    User-agent: LinkWalker
    Disallow: /

    User-agent: cosmos
    Disallow: /

    User-agent: moget
    Disallow: /

    User-agent: hloader
    Disallow: /

    User-agent: humanlinks
    Disallow: /

    User-agent: LinkextractorPro
    Disallow: /

    User-agent: Offline Explorer
    Disallow: /

    User-agent: Mata Hari
    Disallow: /

    User-agent: LexiBot
    Disallow: /

    User-agent: Web Image Collector
    Disallow: /

    User-agent: The Intraformant
    Disallow: /

    User-agent: True_Robot/1.0
    Disallow: /

    User-agent: True_Robot
    Disallow: /

    User-agent: BlowFish/1.0
    Disallow: /

    User-agent: JennyBot
    Disallow: /

    User-agent: MIIxpc/4.2
    Disallow: /

    User-agent: BuiltBotTough
    Disallow: /

    User-agent: ProPowerBot/2.14
    Disallow: /

    User-agent: BackDoorBot/1.0
    Disallow: /

    User-agent: toCrawl/UrlDispatcher
    Disallow: /

    User-agent: WebEnhancer
    Disallow: /

    User-agent: suzuran
    Disallow: /

    User-agent: VCI WebViewer VCI WebViewer Win32
    Disallow: /

    User-agent: VCI
    Disallow: /

    User-agent: Szukacz/1.4
    Disallow: /

    User-agent: QueryN Metasearch
    Disallow: /

    User-agent: Openfind data gathere
    Disallow: /

    User-agent: Openfind
    Disallow: /

    User-agent: Xenu's Link Sleuth 1.1c
    Disallow: /

    User-agent: Xenu's
    Disallow: /

    User-agent: Zeus
    Disallow: /

    User-agent: RepoMonkey Bait & Tackle/v1.01
    Disallow: /

    User-agent: RepoMonkey
    Disallow: /

    User-agent: Microsoft URL Control
    Disallow: /

    User-agent: Openbot
    Disallow: /

    User-agent: URL Control
    Disallow: /

    User-agent: Zeus Link Scout
    Disallow: /

    User-agent: Zeus 32297 Webster Pro V2.9 Win32
    Disallow: /

    User-agent: Webster Pro
    Disallow: /

    User-agent: EroCrawler
    Disallow: /

    User-agent: LinkScan/8.1a Unix
    Disallow: /

    User-agent: Keyword Density/0.9
    Disallow: /

    User-agent: Kenjin Spider
    Disallow: /

    User-agent: Iron33/1.0.2
    Disallow: /

    User-agent: GetRight/4.2
    Disallow: /

    User-agent: FairAd Client
    Disallow: /

    User-agent: Gaisbot
    Disallow: /

    User-agent: Aqua_Products
    Disallow: /

    User-agent: Radiation Retriever 1.1
    Disallow: /

    User-agent: Flaming AttackBot
    Disallow: /

    User-agent: PerMan
    Disallow: /

    User-agent: searchpreview
    Disallow: /

    User-agent: heritrix
    Disallow: /

    User-agent: ScoutJet
    Disallow: /

    User-Agent: Spinn3r
    Disallow: /

    User-agent: omgilibot
    Disallow: /

    User-agent: Wasabot
    Disallow: /

    User-agent: YoudaoBot
    Disallow: /

    User-agent: Exabot
    Disallow: /

    User-agent: Shelob
    Disallow: /

    User-agent: PycURL
    Disallow: /

    User-agent: Nambu
    Disallow: /

    User-agent: Butterfly
    Disallow: /

    User-agent: TELECA
    Disallow: /

    User-agent: Sphere Scout
    Disallow: /

    User-Agent: *
    Disallow: /skins/
    Disallow: /payments/
    Disallow: /store_closed.html
    Disallow: /core/
    Disallow: /lib/
    Disallow: /install/
    Disallow: /js/
    Disallow: /schemas/
    Disallow: /stores/
    Disallow: /addons/
    Disallow: /var/
    Disallow: /xml/
    Disallow: /shippings/
    Disallow: /stores/
    Disallow: /controllers/

    Sitemap: http://www.hadisendeal.com/sitemap.xml

    bu robots.txtden isteğinize göre en alttaki
    Alıntı
    User-Agent: *
    Disallow: /skins/
    Disallow:..
    disallow satırlarını kaldırabilirsiniz (indexlenmesini istemediğiniz sayfalar/klasörler bu alanda duracak..)
  • 30-06-2014, 19:11:27
    #3
    hocam verdiğiniz bilgiler çok faydalı teşekkür ediyorum. peki;

    User-agent: Googlebot
    Allow: /
    Crawl-Delay: 2

    User-agent: Yandex
    Allow: /
    Crawl-Delay: 2

    yukarıdaki Crawl-Delay: 2 anlamı ne ?

    Satır 6: Crawl-Delay: 2 Kural Googlebot tarafından yok sayıldı
    Satır 10: Crawl-Delay: 2 Kural Googlebot tarafından yok sayıldı

    burasını da açıklarsanız sevinirim..
  • 30-06-2014, 19:21:57
    #4
    turkobil adlı üyeden alıntı: mesajı görüntüle
    hocam verdiğiniz bilgiler çok faydalı teşekkür ediyorum. peki;

    User-agent: Googlebot
    Allow: /
    Crawl-Delay: 2

    User-agent: Yandex
    Allow: /
    Crawl-Delay: 2

    yukarıdaki Crawl-Delay: 2 anlamı ne ?

    Satır 6: Crawl-Delay: 2 Kural Googlebot tarafından yok sayıldı
    Satır 10: Crawl-Delay: 2 Kural Googlebot tarafından yok sayıldı

    burasını da açıklarsanız sevinirim..
    crawl-delay örümceklerin sitedeki dolaşımını hızlandırmak-geciktirmek ya da ne sıklıkla (sn cinsinden) sayfalara erişeceğini belirtmek için kullanılıyor yani Crawl-Delay: x girdiğiniz x değeri ile x saniye sıklığıyla sitenize uğrasın diyorsunuz sunucu trafiğini yememesini daha rahat dolaşmasını yönlendirebiliyorsunuz bir nevi botların.. şunlarada göz gezdirebilirsin crawl ve diğer robots konuları hakkında,
    http://yardim.yandex.com.tr/webmaste...robots-txt.xml
    https://support.google.com/webmaster...er/48620?hl=tr
    https://support.google.com/webmaster...r/156449?hl=tr
    http://tr.wikipedia.org/wiki/Robots.txt
  • 30-06-2014, 19:28:13
    #5
    kpssdelisi adlı üyeden alıntı: mesajı görüntüle
    crawl-delay örümceklerin sitedeki dolaşımını hızlandırmak-geciktirmek ya da ne sıklıkla (sn cinsinden) sayfalara erişeceğini belirtmek için kullanılıyor yani Crawl-Delay: x girdiğiniz x değeri ile x saniye sıklığıyla sitenize uğrasın diyorsunuz sunucu trafiğini yememesini daha rahat dolaşmasını yönlendirebiliyorsunuz bir nevi botların.. şunlarada göz gezdirebilirsin crawl ve diğer robots konuları hakkında,
    http://yardim.yandex.com.tr/webmaste...robots-txt.xml
    https://support.google.com/webmaster...er/48620?hl=tr
    https://support.google.com/webmaster...r/156449?hl=tr
    http://tr.wikipedia.org/wiki/Robots.txt
    hocam yardımınız için çok teşekkür ediyorum, hayırlı günler..
  • 30-06-2014, 19:31:04
    #6
    turkobil adlı üyeden alıntı: mesajı görüntüle
    hocam yardımınız için çok teşekkür ediyorum, hayırlı günler..
    Önemli değil hocam son yazdığım linkleri mutlaka inceleyin ama, aklınızdaki tüm soruların cevapları orada sizede hayırlı günler
  • 30-06-2014, 19:35:17
    #7
    kpssdelisi adlı üyeden alıntı: mesajı görüntüle
    Önemli değil hocam son yazdığım linkleri mutlaka inceleyin ama aklınızdaki tüm soruların cevapları orada sizede hayırlı günler
    http://tr.wikipedia.org/wiki/Robots.txt burdan bakıyorum da hocam yine aklım karıştı..

    1.
    User-agent: *
    Disallow:
    Bütün robotların, site üzerindeki hiçbir dosyayı taramamasının istendiği örnek;

    2.
    User-agent: *
    Disallow: /
    Bütün robotlar, site üzerindeki aşağıdaki 4 klasörün içeriğini indekslememeli;

    benim robots.txt dosyasında yukarıdaki 2. seçenek mevcut.. yani bütün robotların site üzerindeki hiçbir dosyayı taramaması mı istenmiş ? yani bütün robotlar sitede indexleme yapmayacak mı?
  • 30-06-2014, 20:59:12
    #8
    turkobil adlı üyeden alıntı: mesajı görüntüle
    http://tr.wikipedia.org/wiki/Robots.txt burdan bakıyorum da hocam yine aklım karıştı..

    1.
    User-agent: *
    Disallow:
    Bütün robotların, site üzerindeki hiçbir dosyayı taramamasının istendiği örnek;

    2.
    User-agent: *
    Disallow: /
    Bütün robotlar, site üzerindeki aşağıdaki 4 klasörün içeriğini indekslememeli;

    benim robots.txt dosyasında yukarıdaki 2. seçenek mevcut.. yani bütün robotların site üzerindeki hiçbir dosyayı taramaması mı istenmiş ? yani bütün robotlar sitede indexleme yapmayacak mı?
    kaydırma yapmışsın hocam
    1-Bütün robotların, site üzerindeki bütün dosyaları tarayabileceğine izin veren örnek; " * " yıldız işareti istisnasız tüm robotları indeksleme yapabileceğini gösterir.

    User-agent: *
    Disallow:


    2-Bütün robotların, site üzerindeki hiçbir dosyayı taramamasının istendiği örnek;

    User-agent: *
    Disallow: /


    3-Bütün robotlar, site üzerindeki aşağıdaki 4 klasörün içeriğini indekslememeli;

    User-agent: *
    Disallow: /cgi-bin/
    Disallow: /images/
    Disallow: /tmp/
    Disallow: /private/

    yazanlar bunlar, ilk mesajdada belirttiğim gibi sizin kullandığınız robots.txt içeriğine göre
    Alıntı
    mesela siz kullandığınız şu satırlarla
    Alıntı
    User-agent: *
    Disallow: /
    belirlediğiniz Googlebot, Yandex, Browsershots örümcekleri dışındaki tüm örümceklere sayfalarımı indexleme demişsiniz...
    son sorunuzun cevabıda evet
    Alıntı
    yani bütün robotlar sitede indexleme yapmayacak mı?
    belirlediğiniz 3 bot dışında indexleme demişsiniz, ilk mesajda son kısımda yazdığım gibi düzenleyebilir o robots.txtyi kullanabilirsiniz, kolay gelsin..
  • 01-07-2014, 02:24:24
    #9
    kpssdelisi adlı üyeden alıntı: mesajı görüntüle
    kaydırma yapmışsın hocam
    1-Bütün robotların, site üzerindeki bütün dosyaları tarayabileceğine izin veren örnek; " * " yıldız işareti istisnasız tüm robotları indeksleme yapabileceğini gösterir.

    User-agent: *
    Disallow:


    2-Bütün robotların, site üzerindeki hiçbir dosyayı taramamasının istendiği örnek;

    User-agent: *
    Disallow: /


    3-Bütün robotlar, site üzerindeki aşağıdaki 4 klasörün içeriğini indekslememeli;

    User-agent: *
    Disallow: /cgi-bin/
    Disallow: /images/
    Disallow: /tmp/
    Disallow: /private/

    yazanlar bunlar, ilk mesajdada belirttiğim gibi sizin kullandığınız robots.txt içeriğine göre

    son sorunuzun cevabıda evet

    belirlediğiniz 3 bot dışında indexleme demişsiniz, ilk mesajda son kısımda yazdığım gibi düzenleyebilir o robots.txtyi kullanabilirsiniz, kolay gelsin..
    tamamdır hocam şimdi anladım, teşekkür ediyorum. Allah razı olsun.