Sitemap-Generator
URL eingeben, und der Crawler folgt internen Links (bis zu 200 Seiten), behält nur die Seiten, die eine Suchmaschine indexieren könnte — Status 200, kein noindex, Canonical auf sich selbst — und schreibt eine schlichte XML-Sitemap zum Herunterladen oder Kopieren. Er liest auch die Sitemap, die die Website bereits veröffentlicht, und zeigt beide Lücken: indexierbare Seiten, die darin fehlen, und Sitemap-URLs, die der Crawl nie erreicht hat. Kein lastmod, priority oder changefreq wird erfunden. Nichts wird länger als 24 Stunden gespeichert.
Der Crawl läuft auf unserem Server: eine Anfrage pro Sekunde, robots.txt wird beachtet, kein JavaScript. Nur die Start-URL und diese Zusammenfassung werden 24 Stunden aufbewahrt.
So funktioniert es
1. Unser Crawler (InsighthackerzBot, eine Anfrage pro Sekunde, kein JavaScript) holt zuerst die robots.txt und die dort deklarierten Sitemaps, startet dann bei Ihrer URL und folgt internen Links in Breitensuche — nur derselbe Host; www und die nackte Domain zählen als eine Website 2. Limits: 50, 100 oder 200 Seiten pro Lauf, 2 MB pro Seite, 15 s pro Anfrage, 5 Weiterleitungen pro URL; URLs, die Ihre robots.txt für unseren User-Agent sperrt, werden übersprungen und gezählt; nofollow-Seiten werden geladen, ihre Links aber nicht verfolgt 3. Jede HTML-Seite läuft durch dieselbe Engine wie der Onpage-SEO-Check: Title, Description, H1, Canonical, Robots-Direktiven, Wortzahl, Bilder ohne Alt — Warnungen und Fehler werden pro Seite behalten, das HTML nicht 4. Interne Links, die beim Crawl als defekt auffallen (4xx, 5xx, Timeouts), werden mit den verlinkenden Seiten gelistet; externe Links werden nur per HEAD geprüft (ein GET, wenn der Server HEAD ablehnt), maximal 100 pro Lauf, nofollow-Links ausgenommen 5. Das Ergebnis ist ein Job auf unserem eigenen Server: Er enthält nur die Start-URL und die Zusammenfassung, verfällt nach 24 Stunden und wird für nichts anderes verwendet 6. Sitemap-Regel: Eine URL wird gelistet, wenn sie 200 lieferte, kein noindex trägt (Meta oder X-Robots-Tag) und ihr Canonical fehlt oder auf sie selbst zeigt; Weiterleitungen, Fehler und Seiten mit Canonical auf andere URLs bleiben draußen. Ausgabe nur <loc>, alphabetisch sortiert
Über XML-Sitemaps und was der Generator aufnimmt
Eine XML-Sitemap ist eine Liste der URLs, die Suchmaschinen kennen sollen. Sie lässt keine Seite ranken und erzwingt keine Indexierung; sie ist ein Hinweis, der Crawlern hilft, Seiten zu finden, die sie sonst spät oder gar nicht erreichen würden — tiefe Seiten, neue Seiten, Seiten mit wenigen internen Links. Google liest das <loc>-Element und, wenn es ihm vertraut, <lastmod>; <priority> und <changefreq> ignoriert es nach eigener Aussage. Dieser Generator schreibt nur <loc>, weil der Crawl nicht wissen kann, wann sich eine Seite zuletzt geändert hat, und Raten das Feld wertlos machen würde.
Welche Seiten in eine Sitemap gehören, ist die eigentliche Frage — und der Punkt, an dem die meisten generierten Sitemaps scheitern. Eine Sitemap sollte kanonische, indexierbare URLs listen und sonst nichts: Eine URL, die weiterleitet, einen Fehler liefert, noindex trägt oder eine andere URL als Canonical nennt, sendet Google ein widersprüchliches Signal — 'indexiere das' aus der Sitemap, 'tu es nicht' von der Seite. Der Generator wendet genau diese vier Filter an und zeigt, welche Seiten warum ausgeschlossen wurden, sodass die Liste, die Sie herunterladen, die Liste ist, die eine Suchmaschine akzeptiert.
Der Vergleich mit der bestehenden Sitemap der Website ist oft nützlicher als die neue Datei. Indexierbare Seiten, die in der veröffentlichten Sitemap fehlen, sind meist Seiten, die das CMS vergessen hat — eine später angelegte Kategorie, eine Landingpage außerhalb des Blogs; Sitemap-URLs, die der Crawl nie erreicht, sind entweder unverlinkt (Waisen, die nur die Sitemap kennt) oder verschwunden. Ein Crawl von 200 Seiten sieht eine große Website nicht vollständig — behandeln Sie beide Listen als Stichproben, nicht als Audits.
Bei Websites, die sich oft ändern, ist eine generierte Sitemap am Tag nach dem Hochladen veraltet. Die richtige Dauerlösung ist eine Sitemap, die das CMS oder Framework selbst erzeugt; dieses Tool ist für die Einzelfälle — eine statische Website, eine Migrationsprüfung, eine Kundenwebsite, die Sie nicht verwalten — und um zu sehen, was ein Crawler tatsächlich findet, wenn er Ihren Links folgt.
Häufige Fragen
- Warum fehlt eine Seite in der generierten Sitemap?
- Vier Gründe, alle beabsichtigt: Die Seite lieferte etwas anderes als 200, sie trägt noindex, ihr Canonical zeigt auf eine andere URL, oder der Crawl hat sie im Seitenlimit nicht erreicht. Der Audit-Tab listet jede gecrawlte Seite mit Status und Direktiven; schauen Sie dort nach, bevor Sie annehmen, der Crawler habe sie übersehen.
- Warum gibt es kein lastmod?
- Weil ein Crawl nicht weiß, wann sich eine Seite geändert hat — der HTTP-Header Last-Modified fehlt auf den meisten Websites oder ist falsch, und ein erfundenes Datum bringt Google bei, Ihrer Sitemap zu misstrauen. Google nutzt lastmod nur, wenn es durchgehend korrekt war. Wenn Ihr CMS die Daten kennt, sollte seine eigene Sitemap sie tragen; diese Datei tut nicht so.
- Nutzt Google priority und changefreq?
- Nein. Google sagt seit 2015, dass es beides ignoriert, und hat sie 2023 aus der Dokumentation entfernt. Bing sagt Ähnliches. Sie werden hier weggelassen, damit die Datei ehrlich und klein bleibt.
- Was bedeutet 'fehlt in der bestehenden Sitemap'?
- Der Crawler hat die Sitemap(s) aus Ihrer robots.txt (oder /sitemap.xml) geholt und mit den gefundenen Seiten verglichen. Seiten, die er indexieren könnte, die aber in Ihrer Sitemap fehlen, stehen dort — typischerweise Seiten, die nach der Sitemap-Erstellung hinzukamen, oder Bereiche, die das CMS nicht aufnimmt. Die umgekehrte Liste, Sitemap-URLs, die der Crawl nicht erreichte, deutet auf verwaiste oder entfernte Seiten.
- Meine Website hat mehr als 200 Seiten. Was nun?
- Der Crawl stoppt am Limit und sagt das. Die generierte Datei ist dann eine Stichprobe, keine vollständige Sitemap — nützlich zum Prüfen der Struktur, nicht zum Hochladen. Große Websites brauchen eine vom CMS erzeugte Sitemap, aufgeteilt in Dateien mit höchstens 50.000 URLs und 50 MB, mit einem Sitemap-Index darüber.
- Wo lege ich die Datei ab?
- Im Stammverzeichnis der Website ist die Konvention (/sitemap.xml), und der Ort muss auf demselben Host liegen wie die gelisteten URLs. Dann in der robots.txt mit einer Sitemap:-Zeile deklarieren und einmal in der Search Console einreichen; danach holt Google sie nach eigenem Zeitplan neu.
- Ist der Crawl sicher für meine Website?
- Er stellt eine Anfrage pro Sekunde, gibt sich als InsighthackerzBot zu erkennen, beachtet Ihre robots.txt, liest höchstens 200 Seiten zu je 2 MB und führt kein JavaScript aus. Eine Website, die diese Last nicht verträgt, hat ein größeres Problem als ihre Sitemap. Wenn Sie ihn aussperren wollen, sperren Sie InsighthackerzBot in der robots.txt — der Crawl stoppt bei der ersten Seite.