Verificatore Sitemap: Trova Pagine Mancanti e in Conflitto
Verificatore Sitemap
Verificatore Sitemap: Valida XML e Trova Pagine Mancanti | We.Inc
Incolla la tua sitemap.xml per verificare l'XML, trovare URL duplicati, http, fuori sito e con date sbagliate, confrontala con le pagine attese e con robots.txt, poi scarica i risultati come CSV.
Apri la tua sitemap (di solito tuosito.com/sitemap.xml), copiala e incollala qui, oppure carica il file. Il verificatore valida l'XML e ogni URL in esso, poi lo confronta con una lista di pagine che ti aspetti e con il tuo robots.txt, così puoi vedere cosa manca, cosa non dovrebbe esserci e cosa è in conflitto. Non visita il tuo sito web: i browser impediscono a un sito di leggerne un altro, quindi verifica ciò che incolli. Tutto gira nel tuo browser. Niente di ciò che digiti viene inviato a We.Inc o a chiunque altro, e sparisce quando chiudi la scheda.
Incolla il contenuto della tua sitemap.xml o carica il file (fino a 10 MB). Anche i file indice sitemap sono riconosciuti; il verificatore elenca le sitemap figlie da incollare una per una.
L'XML è analizzato nel tuo browser. Vedi se è valido, se usa il namespace sitemap standard, e quanti URL contiene rispetto ai limiti di 50.000 URL e 50 MB.
Ogni URL è verificato: indirizzo https completo, stesso host degli altri, nessun fragment #, nessun parametro di tracciamento, nessun duplicato, e una data lastmod valida che non è nel futuro.
Opzionalmente incolla le pagine che ti aspetti siano elencate, come i link nel tuo menu. Il report mostra le pagine attese che mancano dalla sitemap e le pagine della sitemap che non ti aspettavi.
Opzionalmente incolla il tuo robots.txt. Il verificatore segnala gli URL della sitemap che robots.txt blocca, e ti dice se robots.txt non punta a una sitemap.
Scarica i risultati come CSV. Per il codice di stato, canonical e noindex di un singolo URL, esegui il comando curl mostrato sulla pagina.
Elenca solo le pagine che vuoi nei risultati di ricerca: indirizzi https finali che rispondono 200, non sono reindirizzati e sono il proprio canonical.
Rimuovi le pagine che sono noindex. Una sitemap che elenca pagine che chiedi ai motori di ricerca di non indicizzare invia segnali contrastanti.
Usa lastmod solo quando sai la data in cui una pagina è davvero cambiata. Impostare ogni pagina a oggi insegna ai motori di ricerca a ignorare il campo.
Aggiungi una riga Sitemap: con l'indirizzo completo a robots.txt così i crawler possono trovare la sitemap senza che gli venga detto.
Invia la sitemap in Google Search Console e Bing Webmaster Tools, poi controlla i loro report per le pagine che non sono riusciti a recuperare.
Domande frequenti
Questo verificatore di sitemap scansiona il mio sito?
No. Una pagina web non può leggere i file di un altro sito web perché i browser lo impediscono, e noi non eseguiamo un crawler nascosto. Incolli la sitemap, la lista di pagine e robots.txt, e i controlli girano su quel testo. Il report dice esattamente quanti URL ha controllato.
Come verifico codici di stato, canonical e noindex?
Esegui curl -sIL seguito dall'indirizzo della pagina in un terminale per vedere il suo codice di stato e i redirect. Per vedere il canonical e il meta tag robots, esegui curl -sL seguito dall'indirizzo e cerca rel="canonical" e name="robots" nell'output. Il report di indicizzazione pagine di Search Console mostra le stesse prove per tutto il tuo sito.
Quali sono i limiti della sitemap?
Un file sitemap può contenere fino a 50.000 URL ed essere fino a 50 MB non compresso. I siti più grandi dividono i loro URL su diverse sitemap elencate in un file indice sitemap.
Perché sono segnalati gli URL http o su altro dominio?
Una sitemap dovrebbe elencare gli indirizzi finali sullo stesso sito dove vive la sitemap. Gli indirizzi http su un sito https fanno redirect, e gli URL su un altro host sono ignorati dai motori di ricerca a meno che tu non abbia verificato l'invio cross-site.
Una sitemap valida significa che le mie pagine saranno indicizzate?
No. Una sitemap aiuta i motori di ricerca a trovare le pagine; non le fa indicizzare o classificare. Qualità, link e segnali tecnici decidono ancora questo.
Quello che incollo viene salvato?
No. La verifica gira nel tuo browser e niente viene inviato da nessuna parte.
Pagine mancanti e pagine che non dovrebbero essere elencate
Contano due tipi di errori. Le pagine mancanti sono pagine reali che vuoi trovate che la sitemap lascia fuori, spesso nuove pagine di servizio o articoli del blog aggiunti dopo che la sitemap è stata creata. Le pagine indesiderate sono indirizzi che non dovrebbero esserci affatto: redirect, pagine di test, versioni filtrate della stessa pagina, o pagine marcate noindex.
Confrontare la sitemap con una lista di cui ti fidi, come i link nel tuo menu e footer, è il modo più rapido per trovare entrambi. Questo verificatore li mantiene in liste separate così puoi correggerne una alla volta.
Cosa può e non può vedere questa verifica
Tutto qui è basato sul testo che incolli. Può provare che l'XML è valido e che gli URL sono ben formati, coerenti e permessi dal tuo robots.txt. Non può vedere se ogni pagina attualmente risponde 200 o porta un tag noindex, perché questo richiede una visita a ogni pagina. Il report etichetta quelli come non verificati piuttosto che indovinare.