robots.txt Test Aracı
Bir robots.txt dosyasını herhangi bir URL yolu ve bota karşı test edin: siteden getirin ya da yapıştırın; Googlebot, Bingbot, GPTBot, ClaudeBot, PerplexityBot ya da özel bir user-agent seçin ve yola izin veren ya da onu engelleyen kuralı tam olarak görün — ayrıca bot bazında özet, sözdizimi uyarıları ve Sitemap satırları. RFC 9309 eşleştirmesi, tarayıcınızda çalışır, hiçbir şey saklanmaz.
- 1# Örnek — düzenleyin
- 2User-agent: *
- 3Disallow: /admin/
- 4Disallow: /cart
- 5Disallow: /*?sort=
- 6Allow: /admin/help
- 7
- 8User-agent: Googlebot-Image
- 9Disallow: /private-images/
- 10
- 11User-agent: GPTBot
- 12User-agent: CCBot
- 13Disallow: /
- 14
- 15Sitemap: https://www.example.com/sitemap.xml
Vurgulu: bu bota uygulanan grup; güçlü vurgu: kararı veren kural.
Kim neyi tarayabilir
Kök (/) ve test edilen yol /admin/help/getting-started, bot bazında — arama motorları, yapay zeka eğitim botları, yapay zeka yanıt motorları, sosyal medya önizlemeleri ve SEO araçları.
| Bot | Tür | / | Test edilen yol | Kural kaynağı |
|---|---|---|---|---|
| Googlebot | Arama | Evet | Evet | User-agent: * |
| Googlebot-Image | Arama | Evet | Evet | User-agent: googlebot-image |
| Bingbot | Arama | Evet | Evet | User-agent: * |
| Applebot | Arama | Evet | Evet | User-agent: * |
| DuckDuckBot | Arama | Evet | Evet | User-agent: * |
| YandexBot | Arama | Evet | Evet | User-agent: * |
| GPTBot | Yapay zeka eğitimi | Hayır | Hayır | User-agent: gptbot |
| Google-Extended | Yapay zeka eğitimi | Evet | Evet | User-agent: * |
| ClaudeBot | Yapay zeka eğitimi | Evet | Evet | User-agent: * |
| CCBot | Yapay zeka eğitimi | Hayır | Hayır | User-agent: gptbot |
| Bytespider | Yapay zeka eğitimi | Evet | Evet | User-agent: * |
| meta-externalagent | Yapay zeka eğitimi | Evet | Evet | User-agent: * |
| OAI-SearchBot | Yapay zeka yanıtları | Evet | Evet | User-agent: * |
| ChatGPT-User | Yapay zeka yanıtları | Evet | Evet | User-agent: * |
| PerplexityBot | Yapay zeka yanıtları | Evet | Evet | User-agent: * |
| Claude-Web | Yapay zeka yanıtları | Evet | Evet | User-agent: * |
| Amazonbot | Yapay zeka yanıtları | Evet | Evet | User-agent: * |
| facebookexternalhit | Sosyal önizleme | Evet | Evet | User-agent: * |
| AhrefsBot | SEO aracı | Evet | Evet | User-agent: * |
| SemrushBot | SEO aracı | Evet | Evet | User-agent: * |
Sözdizimi ve anlam (0)
Uyarı yok — her satır botların anladığı bir yönerge.
Site haritaları (1)
https://www.example.com/sitemap.xml
Ayrıştırma ve eşleştirme, RFC 9309 ile Google'ın belgelenmiş davranışı izlenerek tarayıcınızda yapılır. Tek sunucu isteği, hiçbir şey saklamayan isteğe bağlı /robots.txt getirme işlemidir. Bir robots.txt kuralı bir taleptir, erişim denetimi değil — kurallara uyan botlar buna saygı gösterir, diğerleri göstermez.
Nasıl çalışır
1. robots.txt yüklenir — sitenin host'undan getirilir (/robots.txt, en fazla 512 KB, yönlendirmeler izlenir) ya da yapıştırılır; eksik dosya (4xx) her şeye izin var demektir, sunucu hatası (5xx) ise Google'ın düzelene kadar hiçbir şeyi taramaması demektir 2. Gruplara ayrıştırılır: ardışık her User-agent satırı dizisi, ardından gelen Allow ve Disallow kurallarını tutan bir grup başlatır; Sitemap satırları geneldir; bilinmeyen yönergeler korunur ve işaretlenir 3. Bot için grup seçilir: botun ürün belirteciyle eşleşen en özgül User-agent belirteci (büyük/küçük harfe duyarsız, ör. Googlebot yerine Googlebot-Image); yalnızca hiçbiri eşleşmezse User-agent: * grubu; ikisi de yoksa her şeye izin var 4. Yol, o gruptaki her kuralla eşleştirilir — * herhangi bir karakter dizisiyle eşleşir, $ sonu sabitler, aksi halde yüzde-normalleştirilmiş yol ve sorgu üzerinde önek eşleşmesi yapılır 5. En uzun eşleşen kalıba sahip kural karar verir; eşitlikte Allow kazanır; eşleşme yoksa izinli 6. Bilinen 20 bot (arama, yapay zeka eğitimi, yapay zeka yanıt motorları, sosyal önizlemeler, SEO araçları) için kök ve test edilen yol üzerinde yinelenir; sözdizimi uyarıları ve Sitemap satırları listelenir
robots.txt ve botların onu nasıl okuduğu hakkında
robots.txt, bir host'un kökünde bulunan ve botlara hangi yolları getirebileceklerini söyleyen düz metin bir dosyadır. Bir taleptir, kilit değil: kurallara uyan botlar — her büyük arama motoru ve bir user-agent yayımlayan yapay zeka botları — taramadan önce onu okur, ancak hiçbir şey onu yok sayan bir botu durdurmaz. Kuralları yalnızca taramayı etkiler, dizine eklemeyi değil: engellenen bir sayfa, başka sayfalar ona bağlantı veriyorsa arama sonuçlarında yine görünebilir, yalnızca açıklaması olmaz. Bir sayfayı dizin dışında tutmak için sayfanın taranabilir olması ve bir noindex etiketi taşıması gerekir.
Eşleştirme kuralları kesindir ve çoğunlukla yanlış anlaşılır. Bir bot yalnızca tek bir grup kullanır: User-agent belirteci kendisiyle en özgül biçimde eşleşen grup ya da o yoksa * grubu — asla ikisi birden değil. O grup içinde, satırların sırası ne olursa olsun en uzun eşleşen yol kalıbı kazanır; bir Allow ile bir Disallow aynı uzunlukta eşleşirse Allow kazanır. * herhangi bir karakter dizisiyle eşleşir, $ bir kalıbı yolun sonuna sabitler; $ olmadan her kural bir önektir. Bu test aracı, bu kuralları RFC 9309 ve Google'ın belgelerinin tanımladığı gibi uygular ve yalnızca sonucu değil, kararı veren satırı gösterir.
Bot bazında özet, robots.txt sitelerin içeriklerini yapay zeka için kimin kullanabileceğine karar verdiği yer hâline geldiği için var. GPTBot, ClaudeBot, CCBot, Google-Extended, Bytespider ve meta-externalagent eğitim verisi toplar; OAI-SearchBot, ChatGPT-User, PerplexityBot ve Claude-Web soruları yanıtlamak için sayfaları getirir ve trafik gönderebilir; Googlebot ve Bingbot arama için dizine ekler. User-agent: * altındaki tek bir Disallow: /, ziyaretçi gönderenler de dahil hepsini bir kerede engeller. Tablo, adı geçen her botun dosyayla yazıldığı hâliyle ne yapacağını gösterir; böylece bu ödünleşim rastlantısal değil, görünür olur.
Uyarılar, davranışı sessizce değiştiren hataları kapsar: herhangi bir User-agent satırından önce yer alan bir kural (yok sayılır), boş bir Disallow (her şeye izin verir), baştaki eğik çizgisi olmayan bir yol, göreli bir Sitemap URL'si, Crawl-delay (Google ve Bing yok sayar), bir Noindex yönergesi (2019'dan beri desteklenmiyor), yinelenen bir grup, bir bayt sırası işareti ve Google'ın okuduğu boyutu aşan bir dosya. Bunların hiçbiri neyin engelleneceğine dair bir tavsiye değildir — bu siteye bağlıdır — yalnızca dosyanın, yazarının söylemek istediğini söyleyip söylemediğine dairdir.
Sık sorulan sorular
- robots.txt içindeki Disallow bir sayfayı Google'dan kaldırır mı?
- Hayır. Googlebot'un sayfayı getirmesini durdurur, ancak URL başka yerlerdeki bağlantılardan yine dizine eklenebilir ve snippet olmadan gösterilebilir. Bir sayfayı kaldırmak ya da dizin dışında tutmak için taranmasına izin verin ve bir meta robots noindex etiketi ya da X-Robots-Tag başlığı ekleyin. Bir sayfayı robots.txt ile engelleyip aynı anda noindex eklemek işe yaramaz, çünkü noindex hiç görülmez.
- Allow ve Disallow ikisi de eşleşirse hangi kural kazanır?
- Yol kalıbı daha uzun olan. Disallow: /admin/ ve Allow: /admin/help ikisi de /admin/help/start ile eşleşir; Allow kalıbı daha uzun olduğu için yol izinlidir. İki kalıp tam olarak aynı uzunluktaysa Allow kazanır. Satır sırasının önemi yoktur.
- User-agent: * grubu Googlebot için de geçerli mi?
- Yalnızca Googlebot'u adlandıran bir grup yoksa. Bir bot tam olarak tek bir grubu izler — belirteci için en özgül eşleşme, o yoksa *. Kurallar gruplar arasında asla birleştirilmez; bu yüzden Disallow satırı olmayan bir Googlebot grubuna sahip bir site, * grubunun engellediği her şeyi Googlebot'un taramasına izin verir.
- Arama motorlarını engellemeden yapay zeka botlarını nasıl engellerim?
- Her yapay zeka botuna kendi grubunu verin ya da birkaç belirteci tek grupta toplayın: User-agent: GPTBot, User-agent: CCBot, ardından Disallow: /. * grubunu ve varsa Googlebot ya da Bingbot gruplarını olduğu gibi bırakın. Özet tablosu, adı geçen hangi botların engellendiğini ve hangi arama botlarının etkilenmediğini gösterir. Google-Extended'ın Gemini eğitimi için kullanımı denetlediğini, Googlebot'un taramasını ise etkilemediğini unutmayın.
- Dosyamda Disallow satırları varken test aracı neden her şeye izin var diyor?
- Çoğunlukla Disallow satırları herhangi bir User-agent satırından önce yer aldığı ya da seçilen botun bu kuralları içermeyen kendi grubu olduğu için. Satır vurgusu hangi grubun uygulandığını gösterir; uyarı listesi hiçbir gruba ait olmayan kuralları işaretler.
- Crawl-delay destekleniyor mu?
- Google ve Bing tarafından değil — Google yönergeyi tamamen yok sayar, Bing ise Webmaster Tools içindeki tarama hızı ayarını tercih eder. Yandex de 2018'de desteği bıraktı; yalnızca bazı küçük botlar hâlâ uyar. Test aracı bunu ayrıştırır ve işaretler; böylece en büyük iki motor için beklediğiniz işi yapmadığını bilirsiniz.
- robots.txt hata döndürürse ne olur?
- 404 ya da başka bir 4xx, robots.txt olmadığı anlamına gelir ve botlar her şeye izin var sayar. 5xx ya da zaman aşımı Google tarafından geçici bir tam engel olarak yorumlanır: taramayı durdurur ve hiç kural olmadığını varsaymadan önce bu durumu 30 güne kadar sürdürebilir. Başka bir host'a yönlendirme izlenir, ancak kurallar yalnızca dosya bulunursa özgün host için geçerli olur.