Sitemap-Prüfer: Fehlende und widersprüchliche Seiten finden
Sitemap-Prüfer
Sitemap-Prüfer: XML validieren und fehlende Seiten finden | We.Inc
Fügen Sie Ihre sitemap.xml ein, um XML-Fehler sowie doppelte, HTTP-, externe und falsch datierte URLs zu finden. Vergleichen Sie erwartete Seiten und robots.txt und laden Sie Ergebnisse als CSV herunter.
Öffnen Sie Ihre Sitemap (meist unter ihreseite.com/sitemap.xml), kopieren Sie den Inhalt und fügen Sie ihn hier ein oder laden Sie die Datei hoch. Der Prüfer validiert das XML und jede URL und vergleicht die Einträge mit einer Liste erwarteter Seiten sowie Ihrer robots.txt. So erkennen Sie fehlende, unerwünschte oder widersprüchliche Einträge. Ihre Website wird nicht aufgerufen: Browser verhindern, dass eine Website die Inhalte einer anderen liest. Geprüft werden nur die von Ihnen eingefügten Daten. Alles läuft in Ihrem Browser. Ihre Eingaben werden weder an We.Inc noch an andere gesendet und beim Schließen des Tabs gelöscht.
Fügen Sie den Inhalt Ihrer sitemap.xml ein oder laden Sie die Datei hoch (bis zu 10 MB). Sitemap-Indexdateien werden ebenfalls erkannt; der Prüfer listet die enthaltenen Sitemaps auf, die Sie einzeln einfügen können.
Das XML wird in Ihrem Browser ausgewertet. Sie sehen, ob es gültig ist, den üblichen Sitemap-Namespace verwendet und wie viele URLs es im Verhältnis zu den Grenzwerten von 50.000 URLs und 50 MB enthält.
Jede URL wird geprüft: vollständige HTTPS-Adresse, derselbe Host wie bei den übrigen URLs, kein #Fragment, keine Tracking-Parameter, keine Duplikate sowie ein gültiges lastmod-Datum, das nicht in der Zukunft liegt.
Fügen Sie optional erwartete Seiten ein, etwa Links aus Ihrem Menü. Der Bericht zeigt erwartete Seiten, die in der Sitemap fehlen, sowie Sitemap-Seiten, mit denen Sie nicht gerechnet haben.
Fügen Sie optional Ihre robots.txt ein. Der Prüfer kennzeichnet Sitemap-URLs, die von robots.txt blockiert werden, und weist darauf hin, wenn robots.txt keine Sitemap angibt.
Laden Sie die Ergebnisse als CSV herunter. Für Statuscode, Canonical und noindex einer einzelnen URL führen Sie den auf der Seite angezeigten curl-Befehl aus.
Führen Sie nur Seiten auf, die in den Suchergebnissen erscheinen sollen: endgültige HTTPS-Adressen, die den Status 200 liefern, nicht weiterleiten und auf sich selbst verweisen.
Entfernen Sie Seiten mit noindex. Eine Sitemap, die Seiten aufführt, deren Indexierung Sie verhindern möchten, sendet widersprüchliche Signale.
Verwenden Sie lastmod nur, wenn Sie wissen, wann eine Seite tatsächlich geändert wurde. Wenn Sie für alle Seiten das heutige Datum setzen, ignorieren Suchmaschinen dieses Feld möglicherweise.
Fügen Sie robots.txt eine Zeile „Sitemap:“ mit der vollständigen Adresse hinzu, damit Crawler die Sitemap finden können.
Reichen Sie die Sitemap in der Google Search Console und den Bing Webmaster Tools ein und prüfen Sie dort die Berichte zu nicht abrufbaren Seiten.
Häufige Fragen
Crawlt dieser Sitemap-Prüfer meine Website?
Nein. Eine Webseite kann die Dateien einer anderen Website nicht lesen, weil Browser das blockieren, und wir führen keinen versteckten Crawler aus. Sie fügen Sitemap, Seitenliste und robots.txt ein; die Prüfungen laufen anhand dieser Texte. Im Bericht steht genau, wie viele URLs geprüft wurden.
Wie prüfe ich Statuscodes, Canonicals und noindex?
Führen Sie im Terminal curl -sIL gefolgt von der Seitenadresse aus, um Statuscode und Weiterleitungen zu sehen. Für Canonical und Robots-Meta-Tag führen Sie curl -sL gefolgt von der Adresse aus und suchen in der Ausgabe nach rel="canonical" und name="robots". Der Bericht zur Seitenindexierung in der Search Console zeigt entsprechende Informationen für die ganze Website.
Welche Sitemap-Grenzwerte gelten?
Eine Sitemap-Datei kann bis zu 50.000 URLs und unkomprimiert bis zu 50 MB enthalten. Größere Websites verteilen ihre URLs auf mehrere Sitemaps, die in einer Sitemap-Indexdatei aufgeführt sind.
Warum werden HTTP- oder URLs anderer Domains markiert?
Eine Sitemap sollte die endgültigen Adressen derselben Website aufführen, auf der die Sitemap liegt. HTTP-Adressen auf einer HTTPS-Website werden weitergeleitet. URLs eines anderen Hosts ignorieren Suchmaschinen, sofern keine websiteübergreifende Einreichung bestätigt wurde.
Werden meine Seiten durch eine gültige Sitemap indexiert?
Nein. Eine Sitemap hilft Suchmaschinen, Seiten zu finden; sie sorgt nicht dafür, dass diese Seiten indexiert oder platziert werden. Dafür sind weiterhin Qualität, Links und technische Signale ausschlaggebend.
Werden meine Eingaben gespeichert?
Nein. Die Prüfung läuft in Ihrem Browser und es werden keine Daten gesendet.
Fehlende und nicht gewünschte Seiten
Zwei Arten von Fehlern sind wichtig. Fehlende Seiten sind echte Seiten, die gefunden werden sollen, aber in der Sitemap fehlen – häufig neue Leistungsseiten oder Blogbeiträge, die nach der Erstellung der Sitemap hinzugekommen sind. Unerwünschte Seiten gehören nicht hinein: Weiterleitungen, Testseiten, gefilterte Varianten derselben Seite oder Seiten mit noindex.
Am schnellsten finden Sie beides, wenn Sie die Sitemap mit einer verlässlichen Liste vergleichen, etwa mit den Links in Menü und Footer. Dieser Prüfer führt die Ergebnisse getrennt auf, damit Sie die Probleme nacheinander beheben können.
Was diese Prüfung erkennen kann und was nicht
Alle Ergebnisse beruhen auf dem eingefügten Text. Der Prüfer kann bestätigen, dass das XML gültig und die URL-Struktur korrekt und einheitlich ist und dass robots.txt die URLs zulässt. Er kann nicht feststellen, ob jede Seite aktuell den Status 200 liefert oder ein noindex-Tag enthält, denn dafür müsste jede Seite aufgerufen werden. Solche Punkte werden als nicht geprüft gekennzeichnet, statt Vermutungen anzustellen.