Broken Link Checker

URL eingeben, und der Crawler folgt internen Links (bis zu 200 Seiten) und meldet jeden Link, der fehlschlägt: 404 und andere 4xx, 5xx, Timeouts und DNS-Fehler — interne Links, die beim Crawl auffallen, externe Links per HEAD-Request geprüft (bis zu 100). Jeder defekte Link kommt mit den Seiten, die auf ihn zeigen, und dem Ankertext, damit Sie den Link oder die Seite reparieren können, statt nur zu wissen, dass etwas kaputt ist. Als CSV herunterladen. Nichts wird länger als 24 Stunden gespeichert.

Ein HEAD-Request pro eindeutiger externer URL, maximal 100. Abwählen für einen schnelleren Crawl.

Der Crawl läuft auf unserem Server: eine Anfrage pro Sekunde, robots.txt wird beachtet, kein JavaScript. Nur die Start-URL und diese Zusammenfassung werden 24 Stunden aufbewahrt.

So funktioniert es

1. Unser Crawler (InsighthackerzBot, eine Anfrage pro Sekunde, kein JavaScript) holt zuerst die robots.txt und die dort deklarierten Sitemaps, startet dann bei Ihrer URL und folgt internen Links in Breitensuche — nur derselbe Host; www und die nackte Domain zählen als eine Website
2. Limits: 50, 100 oder 200 Seiten pro Lauf, 2 MB pro Seite, 15 s pro Anfrage, 5 Weiterleitungen pro URL; URLs, die Ihre robots.txt für unseren User-Agent sperrt, werden übersprungen und gezählt; nofollow-Seiten werden geladen, ihre Links aber nicht verfolgt
3. Jede HTML-Seite läuft durch dieselbe Engine wie der Onpage-SEO-Check: Title, Description, H1, Canonical, Robots-Direktiven, Wortzahl, Bilder ohne Alt — Warnungen und Fehler werden pro Seite behalten, das HTML nicht
4. Interne Links, die beim Crawl als defekt auffallen (4xx, 5xx, Timeouts), werden mit den verlinkenden Seiten gelistet; externe Links werden nur per HEAD geprüft (ein GET, wenn der Server HEAD ablehnt), maximal 100 pro Lauf, nofollow-Links ausgenommen
5. Das Ergebnis ist ein Job auf unserem eigenen Server: Er enthält nur die Start-URL und die Zusammenfassung, verfällt nach 24 Stunden und wird für nichts anderes verwendet
6. Ein Link gilt als defekt, wenn die Antwort 4xx oder 5xx ist oder die Anfrage scheitert (Timeout, DNS, TLS, Verbindung abgelehnt). Weiterleitungen werden bei internen Seiten verfolgt und im Audit-Tab gemeldet, nicht hier

Über defekte Links und wie der Checker sie findet

Ein defekter Link ist ein Link, dessen Ziel nicht mehr antwortet: ein 404, weil die Seite gelöscht oder umbenannt wurde, ein 410, ein 5xx, weil der Server dahinter ausgefallen ist, oder gar keine Antwort, weil die Domain abgelaufen ist. Für Besucher ist er eine Sackgasse; für Suchmaschinen verschwendeter Crawl und ein — wenn auch kleines — Signal, dass die Website nicht gepflegt wird. Interne defekte Links sind ganz Ihre Sache und kommen meist von einer URL-Änderung, die niemand nachgezogen hat; externe verursacht jemand anderes, bemerken müssen Sie sie.

Der Checker behandelt beide Arten bewusst unterschiedlich. Interne Links werden beim Crawlen entdeckt — jede 4xx/5xx-Seite, auf die der Crawler trifft, ist ein defekter Link, und der Crawler weiß bereits, welche Seiten ihn dorthin geschickt haben. Externe Links werden nicht gecrawlt; jede eindeutige externe URL bekommt einen HEAD-Request (ein GET, wenn der Server HEAD ablehnt), einen pro Sekunde und Host, maximal 100 pro Lauf. Das reicht, um tote Domains und gelöschte Seiten zu erwischen, ohne fremde Server zu belasten oder Ihr Crawl-Budget dafür auszugeben.

Die Quellseiten sind wichtiger als die defekte URL selbst. Ein 404, der aus einem alten Blogbeitrag verlinkt ist, ist in fünf Sekunden behoben; derselbe 404 im Footer steht auf jeder Seite und verdient eine Weiterleitung. Die Tabelle listet bis zu fünf Quellseiten pro Link und den Ankertext, was oft reicht, um zu erraten, wohin der Link zeigen sollte.

Manche 'defekten' Links sind keine. Websites hinter Bot-Schutz beantworten HEAD-Anfragen unbekannter Crawler mit 403 oder 429; ein Link auf eine Seite, die Login verlangt, liefert 401; manche Server antworten auf HEAD mit 405 und auf GET mit 200, was der Checker durch einen GET-Versuch abfängt. Ein 403 auf einer bekannten Website ist fast immer die Website, die den Crawler abweist, keine tote Seite — öffnen Sie sie im Browser, bevor Sie den Link entfernen.

Häufige Fragen

Warum zeigt ein funktionierender Link 403 oder 429?
Die Zielwebsite hat unsere Anfrage abgelehnt, nicht die Seite. Cloudflare und ähnliche Dienste stellen unbekannten Crawlern eine Challenge mit 403, Rate-Limits antworten mit 429. Der Checker kann keine Challenge lösen und versucht es nicht. Öffnen Sie die URL im Browser: Wenn sie lädt, ist der Link in Ordnung und der Status ist die Bot-Richtlinie der Website.
Was unterscheidet interne und externe defekte Links?
Interne Links zeigen auf Ihren eigenen Host und werden beim Crawlen gefunden; der Crawler hat die Seite geladen, einen Fehler bekommen und weiß, woher der Link kam. Externe Links zeigen woandershin und werden mit je einer leichten Anfrage geprüft. Interne beheben Sie mit einer Weiterleitung oder durch Aktualisieren des Links; bei externen aktualisieren Sie den Link, suchen eine archivierte Kopie oder entfernen ihn.
Warum wurden manche externen Links nicht geprüft?
Der Lauf begrenzt externe Prüfungen auf 100 eindeutige URLs, eine Anfrage pro Sekunde und Host, um höflich gegenüber anderen Websites zu bleiben und den Job unter wenigen Minuten zu halten. Der Checker sagt, wie viele übersprungen wurden. Links mit rel="nofollow" werden gar nicht geprüft. Wählen Sie die externe Option ab, um sie ganz zu überspringen und schneller zu crawlen.
Folgt der Checker Weiterleitungen?
Bei internen Seiten ja — ein Link auf eine URL, die per 301 auf eine funktionierende Seite zeigt, ist nicht defekt, die Weiterleitung steht aber im Site-Audit, damit Sie die Kette kürzen können. Bei externen Links zählt eine Weiterleitung als funktionierend; der Checker verfolgt sie nicht weiter.
Warum findet der Checker einen Link nicht, von dem ich weiß, dass er defekt ist?
Entweder lag die Seite, die ihn enthält, außerhalb des Crawls (jenseits des Seitenlimits, in der robots.txt gesperrt oder von der Start-URL aus nicht per Link erreichbar), oder der Link wird per JavaScript eingefügt — der Crawler liest das HTML, wie es ausgeliefert wird, und führt keine Skripte aus. Der Audit-Tab zeigt, welche Seiten gecrawlt wurden.
Wie oft sollte ich prüfen?
Externe Links verfallen von selbst — ein paar Prozent pro Jahr auf den meisten Websites —, ein vierteljährlicher Lauf fängt das meiste ab. Interne Links brechen, wenn sich URLs ändern; prüfen Sie direkt nach jeder Migration, jedem Relaunch oder jeder Massenumbenennung. Websites über 200 Seiten brauchen ein Tool, das sie vollständig crawlt; dieses liefert eine Stichprobe.
SEO-AuditURL eingeben, und der Crawler prüft bis zu 200 Seiten so, wie es der erste Durchgang einer Suchmaschine täte: Statuscodes, noindex- und Canonical-Direktiven, fehlende oder doppelte Titles und Descriptions, fehlende H1, dünne Seiten, Bilder ohne Alt, Weiterleitungsketten, defekte Links, verwaiste Seiten, robots.txt- und Sitemap-Abdeckung. Jede Seite bekommt dieselben Onpage-Checks wie der Einzelseiten-Checker; der Bericht gruppiert sie nach Problem und nach Seite. Kein Score, keine erfundenen Prioritäten — Befunde mit Zahlen. Als CSV herunterladen. Nichts wird länger als 24 Stunden gespeichert.Interne-Links-CheckerURL eingeben, und der Crawler bildet den internen Linkgraphen von bis zu 200 Seiten ab: wie viele Seiten auf jede URL verlinken, wie viele Links jede Seite aussendet, wie viele Klicks jede Seite vom Start entfernt ist und auf welche Seiten niemand verlinkt — Waisen, die nur die Sitemap kennt. Die Tabelle ist nach eingehenden Links sortiert, damit die Seiten, die Ihre eigene Website als unwichtig behandelt, unten stehen. Als CSV herunterladen. Nichts wird länger als 24 Stunden gespeichert.Sitemap-GeneratorURL eingeben, und der Crawler folgt internen Links (bis zu 200 Seiten), behält nur die Seiten, die eine Suchmaschine indexieren könnte — Status 200, kein noindex, Canonical auf sich selbst — und schreibt eine schlichte XML-Sitemap zum Herunterladen oder Kopieren. Er liest auch die Sitemap, die die Website bereits veröffentlicht, und zeigt beide Lücken: indexierbare Seiten, die darin fehlen, und Sitemap-URLs, die der Crawl nie erreicht hat. Kein lastmod, priority oder changefreq wird erfunden. Nichts wird länger als 24 Stunden gespeichert.Redirect-CheckerBis zu 20 URLs einfügen und jeden Hop der Weiterleitungskette sehen: Statuscode, Ziel, Cache-Control und Zeit pro Hop, Ziel-URL und -Status, Schleifen, Ketten mit mehr als drei Hops, temporäre 302/307 statt 301, http→https→www-Doppelketten, Meta-Refresh- und JavaScript-Redirects auf der Zielseite, ein Canonical, das der Ziel-URL widerspricht — und optional, ob Googlebot woandershin geschickt wird als ein Browser. Export als CSV. Nichts wird gespeichert.