Sitemapcontrole: vind ontbrekende en tegenstrijdige websitepagina’s
Sitemapcontrole
Sitemapcontrole: controleer XML en vind ontbrekende pagina’s | We.Inc
Plak uw sitemap.xml om de XML te controleren, dubbele, http-, externe en verkeerd gedateerde URL's te vinden, te vergelijken met verwachte pagina's en met robots.txt, en download de bevindingen als CSV.
Open uw sitemap (meestal uwsite.com/sitemap.xml), kopieer die en plak hem hier, of upload het bestand. De checker valideert de XML en elke URL erin, en vergelijkt die dan met een lijst pagina's die u verwacht en met uw robots.txt, zodat u ziet wat ontbreekt, wat er niet zou moeten staan en wat conflicteert. Hij bezoekt uw website niet: browsers blokkeren dat de ene site de andere leest, dus controleert hij wat u plakt. Alles draait in uw browser. Niets wat u typt wordt naar We.Inc of iemand anders gestuurd, en het is weg zodra u het tabblad sluit.
Plak de inhoud van uw sitemap.xml of upload het bestand (tot 10 MB). Sitemap-indexbestanden worden ook herkend; de checker vermeldt de onderliggende sitemaps om er één voor één in te plakken.
De XML wordt in uw browser geparst. U ziet of hij geldig is, of hij de standaard sitemap-namespace gebruikt, en hoeveel URL's hij bevat tegenover de limieten van 50.000 URL's en 50 MB.
Elke URL wordt gecontroleerd: volledig https-adres, dezelfde host als de rest, geen #-fragment, geen trackingparameters, geen duplicaten, en een geldige lastmod-datum die niet in de toekomst ligt.
Plak optioneel de pagina's die u verwacht vermeld te zien, zoals de links in uw menu. Het rapport toont verwachte pagina's die ontbreken in de sitemap en sitemap-pagina's die u niet verwachtte.
Plak optioneel uw robots.txt. De checker markeert sitemap-URL's die robots.txt blokkeert, en vertelt u of robots.txt niet naar een sitemap verwijst.
Download de bevindingen als CSV. Voer voor de statuscode, canonical en noindex van een enkele URL het curl-commando uit dat op de pagina wordt getoond.
Vermeld alleen pagina's die u in zoekresultaten wilt: definitieve https-adressen die 200 teruggeven, niet worden doorgestuurd en hun eigen canonical zijn.
Verwijder pagina's die noindex zijn. Een sitemap die pagina's vermeldt die u zoekmachines vraagt niet te indexeren, geeft tegenstrijdige signalen.
Gebruik lastmod alleen wanneer u de datum weet waarop een pagina echt veranderde. Elke pagina op vandaag instellen leert zoekmachines het veld te negeren.
Voeg een Sitemap:-regel toe met het volledige adres aan robots.txt zodat crawlers de sitemap kunnen vinden zonder dat het ze verteld wordt.
Dien de sitemap in bij Google Search Console en Bing Webmaster Tools, en controleer dan hun rapporten voor pagina's die ze niet konden ophalen.
Veelgestelde vragen
Crawlt deze sitemap checker mijn site?
Nee. Een webpagina kan de bestanden van een andere website niet lezen omdat browsers dit blokkeren, en wij draaien geen verborgen crawler. U plakt de sitemap, de paginalijst en robots.txt, en de controles draaien op die tekst. Het rapport vermeldt precies hoeveel URL's het controleerde.
Hoe controleer ik statuscodes, canonicals en noindex?
Voer curl -sIL gevolgd door het pagina-adres uit in een terminal om de statuscode en redirects te zien. Om de canonical en robots meta-tag te zien, voer curl -sL gevolgd door het adres uit en zoek naar rel="canonical" en name="robots" in de uitvoer. Het rapport paginaindexering van Search Console toont hetzelfde bewijs voor uw hele site.
Wat zijn de sitemaplimieten?
Eén sitemapbestand kan tot 50.000 URL's bevatten en tot 50 MB ongecomprimeerd zijn. Grotere sites verdelen hun URL's over meerdere sitemaps vermeld in een sitemap-indexbestand.
Waarom worden http- of andere-domein-URL's gemarkeerd?
Een sitemap moet de definitieve adressen vermelden op dezelfde site waar de sitemap staat. http-adressen op een https-site redirecten, en URL's op een andere host worden door zoekmachines genegeerd tenzij u geverifieerde cross-site-indiening hebt.
Betekent een geldige sitemap dat mijn pagina's worden geïndexeerd?
Nee. Een sitemap helpt zoekmachines pagina's te vinden; het zorgt er niet voor dat ze die pagina's indexeren of ranken. Kwaliteit, links en technische signalen bepalen dat nog steeds.
Wordt wat ik plak opgeslagen?
Nee. De controle draait in uw browser en er wordt niets naartoe gestuurd.
Ontbrekende pagina's en pagina's die er niet zouden moeten staan
Twee soorten fouten zijn belangrijk. Ontbrekende pagina's zijn echte pagina's die u gevonden wilt hebben en die de sitemap weglaat, vaak nieuwe dienstpagina's of blogberichten toegevoegd nadat de sitemap werd gemaakt. Ongewenste pagina's zijn adressen die daar helemaal niet zouden moeten staan: redirects, testpagina's, gefilterde versies van dezelfde pagina, of pagina's gemarkeerd als noindex.
De sitemap vergelijken met een lijst die u vertrouwt, zoals de links in uw menu en footer, is de snelste manier om beide te vinden. Deze checker houdt ze in aparte lijsten zodat u er één tegelijk kunt oplossen.
Wat deze controle wel en niet kan zien
Alles hier is gebaseerd op de tekst die u plakt. Het kan bewijzen dat de XML geldig is en dat de URL's correct gevormd, consistent en toegestaan door uw robots.txt zijn. Het kan niet zien of elke pagina momenteel 200 teruggeeft of een noindex-tag draagt, omdat daarvoor een bezoek aan elke pagina nodig is. Het rapport labelt die als niet gecontroleerd in plaats van te raden.