Robots.txt Sanatı ve İncelikleri

Google, Bing, Yandex gibi büyük arama motorları bu dosyayı destekler ve tarama işlemi, bu dosyada tanımlanan kurallar doğrultusunda gerçekleştirilir. Yani robots.txt dosyasında yer alan komutlar tamamen tavsiye niteliğinde ve isteğe bağlıdır.

7 dakika okuma

robots.txt, küçük bir komut setine sahip olan ve arama motorlarına yol gösteren bir dosyadır. Bu komutlar, sitenize olan erişimi bölüm bazında ve belirli user-agent’a göre göstermek için kullanılabilir. Arama motoru robotlarını yönetmenin en kolay ve etkin yöntemlerinden birisidir.

Bir çok arama motoru genellikle siteyi taramadan önce bu dosyayı okur ve burada yer alan komutlar doğrultusunda tarama işlemini gerçekleştirir. Bu noktada bilmemiz gereken, tüm web tarayıcılarının (crawler) robots.txt dosyasında yer alan komutları tanımak zorunda olmayışı. Fakat Google, Bing, Yandex gibi büyük arama motorları bu dosyayı destekler ve tarama işlemi, bu dosyada tanımlanan kurallar doğrultusunda gerçekleştirilir. Yani robots.txt dosyasında yer alan komutlar tamamen tavsiye niteliğinde ve isteğe bağlıdır. Teorik olarak web robotları bu kurallara ihtiyaç duymamaktadır. Yani sitenize bir robots.txt dosyası koymanız, mahremiyetinizi garanti altına almaz.

Buradaki kritik noktalardan bir diğeri sitenize ait yönetim paneli, özel dizinleriniz gibi indekslenmemesi tercih edeceğiniz yolları (path) bu dosyaya girmememiz gerekliliği. Robots.txt dosyasını herkes görüntülediği için bu tür hassas içeriklerinizin yolunu davetsiz misafirlere açık etmemeniz gerekiyor. Bu tür sayfa veya dizinleri korumak için şifre veya ip bazlı erişime açma gibi yöntemleri kullanmanız önerilir.

Robots.txt Sanatı ve İncelikleri

Robots.txt Nasıl Oluşturulur?

Öncelikle dosyanın adı “robots.txt” olmalıdır; tamamen küçük harfle. “robots.txt” dosyanız sitenizin sadece kök dizinine yerleştirilmeli ve UTF-8 karakter kodlamasına sahip olmalıdır.

Doğru: http://www.ornek.com/robots.txt

Yanlış: http://www.ornek.com/dosyalar/robots.txt

Ayrıca sitenizde hangi protokolü kullanıyorsanız bu protokole uygun olmalıdır. Örneğin SSL sertifikası kullanıyorsanız:

Doğru: https://www.ornek.com/robots.txt

Yanlış: http://www.ornek.com/robots.txt

Basit düzeyde bir “robots.txt” dosyasında 2 anahtar kelime kullanılır. Bunlar User-agent ve Disallow ‘dur. Öncelikle bu anahtar kelimeleri tanıyalım.

Oturum Başlatma Protokolü (Session Initiation Protocol – SIP) iki veya daha fazla katılımcı arasında bağlantı kuran bir ağ protokolüdür. Bu protokol RFC 3261 (daha önce RFC 2543) dokümanlarında açıklanmış ve HTTP protokolüne çok benzeyen düz metin protokolüdür. Bu protokolde istemcilerin (client) genel adına da User-agent denir.

Disallow, belli bir URL’ye erişilmemesini bildiren komuttur.

Örneklere geçmeden önce birkaç konuya daha değinmemiz gerekli. Bunlardan ilki: “User-agent”. Aşağıdaki tabloda Google’ın kullandığı User-agent listesi yer alıyor.

  • ‘Googlebot’— Temel indeksleme robotu;
  • ‘APIs-Google’ — API servis robotu;
  • ‘Mediapartners-Google’ — Reklam servisine kayıtlı sitelerde kullanılmak üzere;
  • ‘Mediapartners (Googlebot)’ — Reklam servisine kayıtlı sitelerde kullanılmak üzere;
  • ‘AdsBot-Google-Mobile’ — Android web sayfası reklam kalitesini kontrol eder;
  • ‘AdsBot-Google-Mobile’ — iPhone web sayfası reklam kalitesini kontrol eder;
  • ‘AdsBot’ — Masaüstü web sayfası reklam kalitesini denetler;
  • ‘Googlebot-Image’ — Görsel robotu;
  • ‘Googlebot-News’ — Haber robotu;
  • ‘Googlebot-Video’ — Video robotu;
  • ‘AdsBot-Google-Mobile-Apps’ — Android uygulama sayfası reklam kalitesini kontrol eder. AdsBot-Google robotlarının kurallarına uyar.

Aşağıdaki tabloda da Yandex’in kullandığı User-agent listesi yer alıyor.

  • ‘YandexBot’ — Temel indeksleme robotu;
  • ‘YandexMedia’ — Multimedya verilerini indeksleyen robot;
  • ‘YandexImages’ — Yandex.Görsel indeksleyicisi;
  • ‘YaDirectFetcher’ — Yandex.Direct robotu, Direct servisinde kayıtlı sitelerin incelenmesi;
  • ‘YandexBlogs’ — Gönderilen yorumları indeksleyen blog araması robotu;
  • ‘YandexNews’ — Yandex.Haberler robotu;
  • ‘YandexPagechecker’ — Mikro etiket doğrulayıcısı;
  • ‘YandexMetrika’ — Yandex.Metrica robotu;
  • ‘YandexMarket’— Yandex.Market robotu;
  • ‘YandexCalendar’ — Yandex.Takvim robotu.

Buraya kadar öğrendiklerimiz ile birlikte “Googlebot” User-agent’ına sahip bir tarayıcının, “seo” isimli klasöre erişmesini istemediğimizi anlatan bir komut yazalım:

User-agent: Googlebot
Disallow: /seo/

“User-agent” bağımsız, tüm tarayıcılara genel bir kural yazmak isterseniz, istemci adı belirlenen alana “*” (yıldız) karakterini koymanız yeterlidir:

User-agent: *
Disallow: /seo/

Bir sayfayı engellemek istersek komut şunun gibi olur:

User-agent: Googlebot
Disallow: /bu-bir-sayfadir.html

Bir görseli engellemek istersek de komut şunun gibi olur:

User-agent: Googlebot-Image
Disallow: /kopek.jpg

Diğer Anahtar Kelimeler

robots.txt dosyasında User-agent ve Disallow komutu dışında kullanabileceğiniz farklı anahtar kelimeler de vardır. Bunlar:

1) Crawl-delay: (Sadece Yandex kullanıyor) Sunucuda aşırı yük varsa ve indirme isteklerini işlemeye yetişemiyorsa, “Crawl-delay” yönergesi kullanılır. Bu yönerge, bir sayfayı indirme işleminin bitmesi ile sonraki sayfayı indirmeye başlama arasında geçmesi gereken en az süreyi (saniye olarak) arama robotuna belirtmeyi sağlar.

User-agent: *
Disallow: /search
Crawl-delay: 4.5

2) Sitemap: Sitenizde XML formatında sitemap kullanıyorsanız ve robotun bunu bilmesini istiyorsanız, dosya yolunu ‘Sitemap’ yönergesi ile belirtebilirsiniz. Birden fazla “Sitemap:” parametresini kullanabilirsiniz. Örneğin:

User-agent: *
Disallow: /kopek.jpg
Sitemap: https://www.ornek.com/dosyalar/sitemap_1.xml
Sitemap: https://www.ornek.com/dosyalar/sitemap_2.xml

3) Clean-param: (Sadece Yandex kullanıyor) Sitenizin sayfa adresleri içeriklerini etkilemeyen dinamik parametreler (örneğin: oturum, kullanıcı, başvuran vs. tanımlayıcıları) içeriyorsa, bunlar ‘Clean-param’ yönergesinin yardımıyla açıklanabilir.

Bir URL veya path içerisinde bir veya birden fazla içeriği etkilemeyen parametreler, Clean-param: içerisinde & karakteri ile birleştirilerek gereksiz yere taranmaması sağlanabilir. Örneğin:

Clean-param: sid&sort /blog/*.php

Yukarıdaki komut sitenin /blog/ dizini içinde ve .php ile biten URL’lerde “sid” ve “sort” parametresi geçen URL’leri sık taramasına gerek olmadığını belirtir.

Yorum & Notlar

Dosya içerisine kendiniz, yöneticiniz veya herhangi bir sebepten dolayı notlar yazabilirsiniz. Not oluşturmak için satır başına # karakteri eklemeniz yeterlidir. Örneğin:

# Köpek resmini erişime kapatıyorum.
# x.x.xxxx tarihinde geri açılacak.
User-agent: Googlebot-Image
Disallow: /kopek.jpg

Şablon (Kalıp Eşleme) Kuralları / Pattern-matching

Tanımlı olan 2 karakteri kullanarak basit düzeyde regular expressions hazırlayabilir ve kompleks durumlar için şablonlu komutlar oluşturabilirsiniz.

  • * : Yıldız karakteri herhangi bir karakter, yani herhangi bir şey anlamına gelir.
  • $ : Dolar ikonu bir URL’nin sonunu belirtir.

Dosya tiplerini bloklamak için : (Bu kod ile .gif dosyalarını indekslemesin diyoruz)

User-agent: Googlebot
Disallow: /*.gif$

.xls ile biten tüm URL’leri engellemek için (dosya adı her ne olursa olsun uzantısı .xls olanlar engellenir):

User-agent: Googlebot
Disallow: /*.xls$

Dinamik web sayfalarını bloklamak için :

User-agent: Googlebot
Disallow: /*?

Eğer bu kuralı Googlebot için değil tüm tarayıcılar için yazmak istersek:

User-agent: *
Disallow: /*?

Biraz da Eğlence

Intoli, alexa.com top 1M sitenin robots.txt dosyalarını indirip ufak bir analiz yapmış. Böylesi bir testi sık göremediğimiz için sonuçlar da ilgimi çekti. Buna göre sitemap dosya isimleri, teste dahil olan sitelerde genellikle şu şekilde verilmiş:

Sitemap Yolu Görülme
/sitemap.xml 177964
/news-sitemap.xml 11147
/sitemap_index.xml 11045
/SiteMap.aspx 10118
/sitemap.xml.gz 9690
/sitemap 6954
/index.php 4187
/dynamic-sitemaps.xml 3533
/robots.txt 3510
/sitemapindex.xml 3062

Ayrıca “User-agent” özelinde yazılan kuralların kullanım dağılımı da şöyle çıkmış:

User Agent Toplam Allow Disallow Allow/Disallow
Mediapartners-Google* 18920 4152 14768 0.28
Googlebot-Mobile 26625 4751 21874 0.22
Googlebot 340185 38740 301445 0.13
Mediapartners-Google 73376 7879 65497 0.12
* 6669397 702888 5966509 0.12
Googlebot-Image 99444 9625 89819 0.11
Mail.Ru 23161 2203 20958 0.11
AdsBot-Google 19163 1278 17885 0.07
Yandex 380945 22728 358217 0.06
bingbot 67560 3026 64534 0.05
ia_archiver 25585 1093 24492 0.04
Yahoo! Slurp 18180 716 17464 0.04
Baiduspider 29339 968 28371 0.03
msnbot 64826 2005 62821 0.03
Slurp 77745 2258 75487 0.03
MSNBot 18674 390 18284 0.02
MJ12bot 22678 121 22557 0.01
AhrefsBot 24014 36 23978 0.00
Exabot 18194 24 18170 0.00
adsbot-google 47388 28 47360 0.00

Paylaş:

0 Yorum


Yorum yaz

Diğer Yazılar

Yapay Zeka Çöplüğüne (AI Slop) Karşı Yeni Bir Savunma Hattı: LoRA Destekli Çok Modlu Savunma Sistemi

Yapay Zeka Çöplüğüne (AI Slop) Karşı Yeni Bir Savunma Hattı: LoRA Destekli Çok Modlu Savunma Sistemi

İnternet ekosistemi ve özellikle çevrimiçi video platformları (OVP), son yıllarda benzeri görülmemiş ve katlanarak artan bir tehdit ile karşı karşıya. Kötü niyetli aktörlerin organize bir şekilde hareket ederek Üretken Yapay Zeka (Generative AI) araçlarını kötüye kullanması, platformların "Yapay Zeka Çöplüğü" veya "AI Slop" olarak adlandırılan kalitesiz, manipülatif ve spam içeriklerle dolup taşmasına neden oluyor.

Microsoft Advertising UTM Auto-Tagging Güncellemesi

Microsoft Advertising UTM Auto-Tagging Güncellemesi

Microsoft Advertising, 2 Eylül 2026 itibarıyla UTM auto-tagging sisteminde önemli bir güncellemeye gidiyor. Bu değişiklik, Microsoft Advertising trafiğinin Google Analytics 4 ve benzeri üçüncü taraf analiz platformlarında daha doğru sınıflandırılmasını hedefliyor.

Pagination (Sayfalandırma) mı, Infinite Scroll (Sonsuz Kaydırma) mı?

Pagination (Sayfalandırma) mı, Infinite Scroll (Sonsuz Kaydırma) mı?

Pagination ve Infinite Scroll arasındaki tercih, kullanıcı deneyimi ile SEO performansını doğrudan etkiler. Pagination, sayfa yapısını düzenli tutarak arama motorlarının içeriği daha iyi taramasını sağlar. Infinite Scroll ise özellikle mobilde akıcı bir gezinme sunar ancak ölçümleme ve indeksleme açısından dikkatli kurgulanmalıdır. Markaların karar verirken içerik yoğunluğu, kullanıcı davranışları ve teknik altyapıyı birlikte değerlendirmesi gerekir. Bu yazıda iki yaklaşımın avantajlarını ve hangi senaryoda daha doğru seçim olacağını bulabilirsiniz.

Google Benim İşletmem ile Markanızı Daha Fazla Görünür Kılın ve Yönetin

Google Benim İşletmem ile Markanızı Daha Fazla Görünür Kılın ve Yönetin

Günümüzde fiziksel bir mağazası olan ya da belirli bir bölgede hizmet veren işletmeler için dijitalde görünür olmak artık bir lüks değil, zorunluluk haline geldi. Kullanıcılar yakınlarındaki işletmeleri keşfetmek için pusula yerine Google Arama ve Google Haritalar’ı kullanıyor. “Kadıköy kahve”, “Çekmeköy kahvaltı”, “Eskişehir çiçekçi” gibi sorguların büyük bölümü yerel sonuçlar üzerinden müşteriye dönüşüyor. Bu nedenle, işletme profilinizi doğru yapılandırdığınızda potansiyel müşterilerin sizi tercih etme ihtimali ciddi oranda artar.

A4 Ebatında Etiketlerle İade Problemi Önleniyor: Çin’in Moda E-Ticaretinde Yeni Strateji

A4 Ebatında Etiketlerle İade Problemi Önleniyor: Çin’in Moda E-Ticaretinde Yeni Strateji

Çin'de online moda alışverişinde iade oranları çok yükseldiği için markalar kötü niyetli kullan-iade davranışını engellemek adına A4 boyutunda büyük ve gizlenmesi zor etiketler kullanmaya başladı. Bu yöntem hem maliyetleri düşürmek hem de ürünleri giyip fotoğraf çektikten sonra iade eden kullanıcıların önünü kesmek için hızla yayılıyor. Tartışmalar sürse de sektör bu uygulamanın iade kültürünü kökten değiştirecek yeni bir dönemin başlangıcı olabileceğini düşünüyor.

Yeni Sağlık Tanıtım Yönetmeliği Neler Getiriyor?

Yeni Sağlık Tanıtım Yönetmeliği Neler Getiriyor?

Sağlık alanında hizmet veren her kurum için tanıtım artık yalnızca pazarlama konusu değil. Aynı zamanda çok net çizilmiş hukuki sınırları olan bir alan. "Sağlık Hizmetlerinde Tanıtım ve Bilgilendirme Faaliyetleri Hakkında Yönetmelik" ile birlikte hekimlerin, özel sağlık tesislerinin ve uluslararası sağlık turizmi aracı kuruluşlarının dijitalde ve geleneksel mecralarda nasıl görünür olabileceği detaylı şekilde yeniden düzenlendi.

eBay Inc. 2025 3. Çeyrek Sonuçlarını Açıkladı

eBay Inc. 2025 3. Çeyrek Sonuçlarını Açıkladı

eBay Inc., 2025 yılının 3. çeyreğinde güçlü bir performans sergileyerek gelirini %9 artırarak 2,8 milyar USD'ye yükseltti ve Brüt Mal Hacmi (GMV) ise %10 artarak 20,1 milyar USD'ye ulaştı. Hisse başına kazanç, GAAP'a göre 1,28 USD, non-GAAP'a göre ise 1,36 USD olarak gerçekleşti.

Avrupa ve Türkiye’de Pazaryerlerinin Yükselişi: 247,5 Milyar Avroluk Bir Dönüşüm

Avrupa ve Türkiye’de Pazaryerlerinin Yükselişi: 247,5 Milyar Avroluk Bir Dönüşüm

E-ticaret dünyası, son yıllarda benzeri görülmemiş bir dönüşüm geçiriyor. Bu dönüşümün merkezinde ise artık sadece markalar değil, pazaryerleri (marketplaces) yer alıyor. Avrupa’daki en güncel verilere göre sınır-ötesi e-ticaretin (cross-border) toplam hacmi 358,7 milyar avroya ulaşırken, bunun 247,5 milyar avroluk kısmı — yani yaklaşık yüzde 70’i — pazaryerleri üzerinden gerçekleşiyor.

İlaç ve Tıbbi Cihaz Satışındaki e-fatura Düzenleme Zorunluluğu

İlaç ve Tıbbi Cihaz Satışındaki e-fatura Düzenleme Zorunluluğu

Türkiye'de sağlık ürünleri ticaretinde dijitalleşme süreci, 1 Ekim 2025 tarihi itibarıyla önemli bir aşamaya geldi. Bu tarihten itibaren, Türkiye İlaç ve Tıbbi Cihaz Kurumu'na (TİTCK) İlaç Takip Sistemi (İTS) ve Ürün Takip Sistemi (ÜTS) üzerinden bildirimi yapılan ilaç ve tıbbi cihazlar için e-fatura düzenleme zorunluluğu getirildi.

Dijitalin nabzını bizimle takip et

Dijital dünyayı şekillendiren seçilmiş içgörüler, haberler ve fikirlerden haberdar olmak için abone olun.