Vérificateur de sitemap : pages manquantes et en conflit
Vérificateur de sitemap
Vérificateur de sitemap : valider le XML et trouver les pages manquantes | We.Inc
Collez votre sitemap.xml pour vérifier le XML, trouver les URL en double, http, hors site et mal datées, le comparer aux pages attendues et au robots.txt, puis téléchargez les résultats en CSV.
Ouvrez votre sitemap (généralement votresite.com/sitemap.xml), copiez-le et collez-le ici, ou importez le fichier. Le vérificateur valide le XML et chaque URL qu'il contient, puis le compare à une liste de pages que vous attendez et à votre robots.txt, pour que vous voyiez ce qui manque, ce qui ne devrait pas y être et ce qui est en conflit. Il ne visite pas votre site : les navigateurs empêchent un site de lire un autre, il vérifie donc ce que vous collez. Tout se passe dans votre navigateur. Rien de ce que vous saisissez n'est envoyé à We.Inc ni à personne d'autre, et tout disparaît quand vous fermez l'onglet.
Collez le contenu de votre sitemap.xml ou importez le fichier (jusqu'à 10 Mo). Les fichiers d'index de sitemap sont aussi reconnus ; le vérificateur liste les sitemaps enfants à coller un par un.
Le XML est analysé dans votre navigateur. Vous voyez s'il est valide, s'il utilise l'espace de noms de sitemap standard, et combien d'URL il contient face aux limites de 50 000 URL et 50 Mo.
Chaque URL est vérifiée : adresse https complète, même hôte que le reste, pas de fragment #, pas de paramètres de suivi, pas de doublons, et une date lastmod valide qui n'est pas dans le futur.
Collez éventuellement les pages que vous attendez, comme les liens de votre menu. Le rapport montre les pages attendues manquantes du sitemap et les pages du sitemap que vous n'attendiez pas.
Collez éventuellement votre robots.txt. Le vérificateur signale les URL du sitemap que robots.txt bloque, et vous dit si robots.txt ne pointe pas vers un sitemap.
Téléchargez les résultats en CSV. Pour le code de statut, la balise canonique et noindex d'une seule URL, exécutez la commande curl montrée sur la page.
Ne listez que les pages que vous voulez dans les résultats de recherche : adresses https finales qui répondent 200, ne sont pas redirigées et sont leur propre canonique.
Retirez les pages qui sont noindex. Un sitemap qui liste des pages que vous demandez aux moteurs de recherche de ne pas indexer envoie des signaux contradictoires.
N'utilisez lastmod que lorsque vous connaissez la vraie date de changement d'une page. Mettre chaque page à aujourd'hui apprend aux moteurs de recherche à ignorer le champ.
Ajoutez une ligne Sitemap: avec l'adresse complète à robots.txt pour que les robots trouvent le sitemap sans qu'on le leur dise.
Soumettez le sitemap dans Google Search Console et Bing Webmaster Tools, puis vérifiez leurs rapports pour les pages qu'ils n'ont pas pu récupérer.
Questions fréquentes
Ce vérificateur de sitemap explore-t-il mon site ?
Non. Une page web ne peut pas lire les fichiers d'un autre site car les navigateurs l'empêchent, et nous n'exécutons pas de robot caché. Vous collez le sitemap, la liste de pages et robots.txt, et les vérifications s'exécutent sur ce texte. Le rapport dit exactement combien d'URL il a vérifiées.
Comment vérifier les codes de statut, canoniques et noindex ?
Exécutez curl -sIL suivi de l'adresse de la page dans un terminal pour voir son code de statut et ses redirections. Pour voir la balise canonique et meta robots, exécutez curl -sL suivi de l'adresse et cherchez rel="canonical" et name="robots" dans le résultat. Le rapport d'indexation des pages de Search Console montre les mêmes preuves pour tout votre site.
Quelles sont les limites d'un sitemap ?
Un fichier de sitemap peut contenir jusqu'à 50 000 URL et faire jusqu'à 50 Mo non compressé. Les grands sites répartissent leurs URL sur plusieurs sitemaps listés dans un fichier d'index de sitemap.
Pourquoi les URL http ou d'un autre domaine sont-elles signalées ?
Un sitemap devrait lister les adresses finales sur le même site où se trouve le sitemap. Les adresses http sur un site https redirigent, et les URL sur un autre hôte sont ignorées par les moteurs de recherche sauf soumission croisée vérifiée.
Un sitemap valide signifie-t-il que mes pages seront indexées ?
Non. Un sitemap aide les moteurs de recherche à trouver des pages ; il ne les fait pas indexer ou classer. La qualité, les liens et les signaux techniques décident toujours de cela.
Ce que je colle est-il stocké ?
Non. La vérification s'exécute dans votre navigateur et rien n'est envoyé nulle part.
Pages manquantes et pages qui ne devraient pas être listées
Deux types d'erreurs comptent. Les pages manquantes sont de vraies pages que vous voulez trouvées et que le sitemap omet, souvent de nouvelles pages de service ou articles de blog ajoutés après la création du sitemap. Les pages indésirables sont des adresses qui ne devraient pas y être du tout : redirections, pages de test, versions filtrées de la même page, ou pages marquées noindex.
Comparer le sitemap avec une liste de confiance, comme les liens de votre menu et footer, est le moyen le plus rapide de trouver les deux. Ce vérificateur les garde dans des listes séparées pour que vous puissiez corriger l'une à la fois.
Ce que cette vérification peut et ne peut pas voir
Tout ici est basé sur le texte que vous collez. Il peut prouver que le XML est valide et que les URL sont bien formées, cohérentes et autorisées par votre robots.txt. Il ne peut pas voir si chaque page répond actuellement 200 ou porte une balise noindex, car cela nécessite une visite de chaque page. Le rapport les étiquette comme non vérifiées plutôt que de deviner.