Dijital Görünürlük, Web & AI

Robots.txt

Diğer kullanım
Robots exclusion protocol

Hızlı Tanım

Robots.txt, bir sitedeki belirli URL yollarına hangi otomatik tarayıcıların erişmesine izin verildiğini veya erişiminin istenmediğini bildiren, sitenin kökünde sunulan metin tabanlı kontrol dosyasıdır.

Kavramın Açıklaması

Robots Exclusion Protocol, otomatik istemcilerin hangi URI'lere erişmesinin istenmediğini bildirmek için kullanılan standartlaştırılmış bir protokoldür. RFC 9309, robots.txt kurallarının erişim yetkilendirmesi veya güvenlik mekanizması olmadığını özellikle belirtir.[1]

Google açısından robots.txt'nin temel işlevi taramayı yönetmektir. Bir URL'yi robots.txt ile engellemek, o URL'nin arama sonuçlarında kesinlikle görünmeyeceği anlamına gelmez. Google başka sayfalardaki bağlantılardan URL'yi keşfederse, içeriği taramadan URL adresini bazı durumlarda indeksleyebilir.[2]

Bu nedenle özel veya hassas içeriği robots.txt ile “gizlemek” doğru değildir. Gerçek erişim kısıtlaması için parola, kimlik doğrulama veya uygun sunucu erişim kontrolleri gerekir; Google sonuçlarından çıkarmak istenen erişilebilir sayfalarda ise uygun noindex yöntemi kullanılabilir.[1][2]

Robots.txt ile meta robots kuralları da farklı katmanlardır. İlki tarayıcının URL'ye erişimini düzenler; ikincisi ise sayfa taranabildiğinde indeksleme ve sunumla ilgili talimatlar verebilir.

Neden Önemli?

Robots.txt dosyasındaki küçük bir kapsam hatası önemli sayfaların veya gerekli kaynakların taranmasını engelleyebilir. Tersi durumda, taranması gereksiz URL alanları arama motoru tarayıcılarının zamanını tüketebilir. Dosyanın işlevini “indeks aç/kapat düğmesi” gibi değil, tarama erişimi katmanı olarak anlamak teknik SEO açısından temel bir ayrımdır.

Kaynaklar

  1. IETF / RFC Editor: RFC 9309: Robots Exclusion Protocol — Eylül 2022
  2. Google Search Central: Introduction to robots.txt