Sitemap Oluşturucu
Bir URL girin; tarayıcı iç bağlantıları izler (200 sayfaya kadar), yalnızca bir arama motorunun indeksleyebileceği sayfaları tutar — 200 durum, noindex yok, canonical kendisini gösteriyor — ve indirip kopyalayabileceğiniz sade bir XML sitemap yazar. Sitenin zaten yayınladığı sitemap'i de okur ve iki boşluğu gösterir: sitemap'te olmayan indekslenebilir sayfalar ve taramanın hiç ulaşmadığı sitemap URL'leri. lastmod, priority ya da changefreq uydurulmaz. 24 saatten uzun hiçbir şey saklanmaz.
Tarama sunucumuzda çalışır: saniyede bir istek, robots.txt'e uyum, JavaScript yok. Yalnızca başlangıç URL'si ve bu özet 24 saat tutulur.
Nasıl çalışır
1. Tarayıcımız (InsighthackerzBot, saniyede bir istek, JavaScript yok) önce robots.txt'i ve bildirdiği sitemap'leri getirir, sonra verdiğiniz URL'den başlayıp iç bağlantıları genişlik-öncelikli izler — yalnızca aynı host; www ve çıplak alan adı tek site sayılır 2. Sınırlar: çalıştırma başına 50, 100 ya da 200 sayfa, sayfa başına 2 MB, istek başına 15 sn, URL başına 5 yönlendirme; robots.txt'inizin user-agent'ımıza yasakladığı URL'ler atlanır ve sayılır, nofollow işaretli sayfalar getirilir ama bağlantıları izlenmez 3. Her HTML sayfa, sayfa içi SEO kontrol aracıyla aynı motordan geçer: title, description, H1, canonical, robots direktifleri, kelime sayısı, alt'sız görseller — uyarılar ve hatalar sayfa başına tutulur, HTML tutulmaz 4. Tarama sırasında kırık bulunan iç bağlantılar (4xx, 5xx, zaman aşımı) onlara bağlantı veren sayfalarla listelenir; dış bağlantılar yalnızca HEAD ile kontrol edilir (sunucu HEAD'i reddederse bir GET), çalıştırma başına en fazla 100, nofollow bağlantılar hariç 5. Sonuç kendi sunucumuzda tek bir iştir: yalnızca başlangıç URL'sini ve özeti tutar, 24 saat sonra silinir ve başka hiçbir şey için kullanılmaz 6. Sitemap kuralı: 200 dönen, noindex (meta ya da X-Robots-Tag) taşımayan ve canonical'ı olmayan ya da kendisini gösteren URL listelenir; yönlendirmeler, hatalar ve canonical'ı başka yeri gösteren sayfalar dışarıda kalır. Çıktı yalnızca <loc>, alfabetik sıralı
XML sitemap'ler ve oluşturucunun neyi dahil ettiği hakkında
XML sitemap, arama motorlarının bilmesini istediğiniz URL'lerin listesidir. Sayfayı sıralatmaz, indekslemeyi zorlamaz; tarayıcıların geç ulaşabileceği ya da hiç ulaşamayacağı sayfaları — derin sayfalar, yeni sayfalar, az iç bağlantısı olanlar — bulmasına yardım eden bir ipucudur. Google <loc> öğesini ve güvendiğinde <lastmod>'u okur; <priority> ve <changefreq>'i yok saydığını açıkça söyledi. Bu oluşturucu yalnızca <loc> yazar, çünkü tarama bir sayfanın en son ne zaman değiştiğini bilemez ve tahmin etmek alanı değersizleştirir.
Asıl soru hangi sayfaların sitemap'e ait olduğudur ve üretilen sitemap'lerin çoğu burada yanlış yapar. Sitemap canonical, indekslenebilir URL'leri listelemeli, başka hiçbir şeyi değil: yönlendiren, hata dönen, noindex işaretli ya da canonical olarak başka bir URL'yi bildiren bir URL Google'a çelişkili sinyal gönderir — sitemap'ten 'bunu indeksle', sayfadan 'indeksleme'. Oluşturucu tam olarak bu dört filtreyi uygular ve hangi sayfaların neden dışarıda kaldığını gösterir; indirdiğiniz liste bir arama motorunun kabul edeceği listedir.
Sitenin mevcut sitemap'iyle karşılaştırma çoğu zaman yeni dosyadan daha yararlıdır. Yayınlanan sitemap'te olmayan indekslenebilir sayfalar genellikle CMS'in unuttuğu sayfalardır — sonradan eklenen bir kategori, blog dışındaki bir açılış sayfası; taramanın hiç ulaşmadığı sitemap URL'leri ya bağlantısızdır (yalnızca sitemap'in bildiği yetim sayfalar) ya da artık yoktur. 200 sayfalık tarama büyük bir siteyi bütünüyle göremez; iki listeyi de denetim değil örneklem olarak okuyun.
Sık değişen sitelerde üretilen sitemap yüklediğiniz günün ertesinde bayatlar. Uzun vadede doğru cevap CMS'in ya da framework'ün kendi ürettiği sitemap'tir; bu araç tek seferlik durumlar içindir — statik bir site, taşınma kontrolü, yönetmediğiniz bir müşteri sitesi — ve bir tarayıcının bağlantılarınızı izlediğinde gerçekte ne bulduğunu görmek için.
Sık sorulan sorular
- Bir sayfa üretilen sitemap'te neden yok?
- Dört neden, hepsi bilinçli: sayfa 200 dışında bir şey döndü, noindex taşıyor, canonical'ı başka bir URL'yi gösteriyor ya da tarama sayfa sınırı içinde ona ulaşamadı. Denetim sekmesi taranan her sayfayı durumu ve direktifleriyle listeler; tarayıcının kaçırdığını varsaymadan önce oraya bakın.
- Neden lastmod yok?
- Çünkü tarama bir sayfanın ne zaman değiştiğini bilmez — HTTP Last-Modified başlığı çoğu sitede ya yoktur ya yanlıştır ve tarih uydurmak Google'a sitemap'inize güvenmemeyi öğretir. Google lastmod'u yalnızca tutarlı biçimde doğru olduğunda kullanır. CMS'iniz tarihleri biliyorsa kendi sitemap'i taşımalı; bu dosya bilir gibi yapmaz.
- Google priority ve changefreq kullanıyor mu?
- Hayır. Google 2015'ten beri ikisini de yok saydığını söylüyor ve 2023'te belgelerinden çıkardı. Bing de benzer şeyler söylüyor. Dosya dürüst ve küçük kalsın diye burada yazılmıyor.
- 'Mevcut sitemap'te yok' ne demek?
- Tarayıcı robots.txt'inizin bildirdiği sitemap'leri (ya da /sitemap.xml'i) getirdi ve bulduğu sayfalarla karşılaştırdı. İndeksleyebileceği ama sitemap'inizde olmayan sayfalar orada listelenir — genellikle sitemap üretildikten sonra eklenen sayfalar ya da CMS'in dahil etmediği bölümler. Ters liste, taramanın ulaşmadığı sitemap URL'leri, yetim ya da kaldırılmış sayfalara işaret eder.
- Sitemde 200'den fazla sayfa var. Ne olacak?
- Tarama sınırda durur ve bunu söyler. Üretilen dosya o zaman tam bir sitemap değil örneklemdir — yapıyı kontrol etmek için yararlı, yüklemek için değil. Büyük siteler CMS'in ürettiği, her biri en fazla 50.000 URL ve 50 MB olan dosyalara bölünmüş ve üstünde bir sitemap indeksi olan sitemap ister.
- Dosyayı nereye koyacağım?
- Gelenek sitenin kökü (/sitemap.xml) ve konum listelediği URL'lerle aynı host'ta olmalı. Sonra robots.txt'de bir Sitemap: satırıyla bildirin ve Search Console'da bir kez gönderin; sonrasında Google kendi programıyla yeniden getirir.
- Tarama sitem için güvenli mi?
- Saniyede bir istek atar, kendini InsighthackerzBot olarak tanıtır, robots.txt'inize uyar, her biri en fazla 2 MB olan en fazla 200 sayfa okur ve JavaScript çalıştırmaz. Bu yükü kaldıramayan sitenin sitemap'inden büyük bir sorunu vardır. Dışarıda tutmak isterseniz robots.txt'de InsighthackerzBot'u yasaklayın; tarama ilk sayfada durur.