Comprobador de sitemap: encuentra páginas faltantes y contradictorias
Comprobador de sitemap
Comprobador de sitemap: valida XML y encuentra páginas faltantes | We.Inc
Pega tu sitemap.xml para validar el XML, detectar URL duplicadas, http, externas y mal fechadas, compararlo con las páginas esperadas y robots.txt y descargar los hallazgos como CSV.
Abre tu sitemap (normalmente tusitio.com/sitemap.xml), cópialo y pégalo aquí, o sube el archivo. El comprobador valida el XML y cada URL, y lo compara con una lista de páginas esperadas y con robots.txt para mostrarte qué falta, qué no debería estar y qué presenta conflictos. No visita tu sitio: los navegadores impiden que un sitio lea otro, así que revisa lo que pegas. Todo funciona en tu navegador. No enviamos a We.Inc ni a nadie más lo que escribas, y se borra al cerrar la pestaña.
Pega el contenido de sitemap.xml o sube el archivo (hasta 10 MB). También se reconocen los índices de sitemap; el comprobador enumera los sitemaps secundarios para que pegues cada uno por separado.
El XML se analiza en tu navegador. Verás si es válido, si usa el espacio de nombres estándar y cuántas URL contiene frente al límite de 50,000 URL y 50 MB.
Se comprueba cada URL: dirección https completa, mismo host que las demás, sin fragmento # ni parámetros de seguimiento, sin duplicados y con fecha lastmod válida y no futura.
Si quieres, pega las páginas que esperas encontrar, como los enlaces del menú. El informe muestra las que faltan del sitemap y las páginas del sitemap que no esperabas.
Si quieres, pega también robots.txt. El comprobador marca las URL del sitemap bloqueadas por robots.txt e indica si robots.txt no enlaza a ningún sitemap.
Descarga los hallazgos como CSV. Para revisar el código de estado, canonical y noindex de una URL, ejecuta el comando curl que aparece en la página.
Incluye solo páginas que quieras en los resultados de búsqueda: URL https finales que respondan 200, no tengan redirecciones y sean su propia canonical.
Elimina las páginas con noindex. Incluir en el sitemap páginas que pides a los buscadores que no indexen da señales contradictorias.
Usa lastmod solo si conoces la fecha real de modificación. Si pones la fecha de hoy en todas las páginas, los buscadores dejarán de tomar en cuenta ese campo.
Añade una línea Sitemap: con la dirección completa a robots.txt para que los rastreadores encuentren el sitemap automáticamente.
Envía el sitemap a Google Search Console y Bing Webmaster Tools, y revisa sus informes para encontrar páginas que no pudieron obtener.
Preguntas frecuentes
¿Este comprobador rastrea mi sitio?
No. Una página web no puede leer los archivos de otro sitio porque los navegadores lo impiden, y no ejecutamos un rastreador oculto. Pega el sitemap, la lista de páginas y robots.txt; las comprobaciones se hacen sobre ese texto. El informe indica exactamente cuántas URL comprobó.
¿Cómo reviso los códigos de estado, canonical y noindex?
Ejecuta curl -sIL seguido de la dirección de la página en una terminal para ver el código de estado y las redirecciones. Para ver la canonical y la etiqueta meta robots, ejecuta curl -sL seguido de la dirección y busca rel="canonical" y name="robots" en el resultado. El informe de indexación de páginas de Search Console muestra la misma información de todo el sitio.
¿Cuáles son los límites del sitemap?
Un archivo sitemap puede contener hasta 50,000 URL y pesar hasta 50 MB sin comprimir. Los sitios más grandes dividen las URL entre varios sitemaps indicados en un archivo de índice.
¿Por qué se marcan las URL http o de otros dominios?
El sitemap debe enumerar las direcciones finales del mismo sitio donde está alojado. Las direcciones http en un sitio https se redirigen, y los buscadores ignoran las URL de otro host salvo que hayas verificado el envío entre sitios.
¿Un sitemap válido garantiza que se indexen mis páginas?
No. Ayuda a los buscadores a encontrar páginas, pero no garantiza que las indexen ni las posicionen. Eso depende de la calidad, los enlaces y otras señales técnicas.
¿Se guarda lo que pego?
No. La comprobación se ejecuta en tu navegador y no se envía nada.
Páginas faltantes y páginas que no deberían aparecer en el sitemap
Importan dos tipos de errores. Las páginas faltantes son páginas reales que quieres que encuentren pero que no aparecen en el sitemap, a menudo servicios nuevos o publicaciones añadidas después. Las páginas no deseadas son direcciones que no deberían estar ahí: redirecciones, páginas de prueba, versiones filtradas del mismo contenido o páginas con noindex.
Comparar el sitemap con una lista fiable, como los enlaces del menú y el pie de página, es la forma más rápida de detectar ambas. Este comprobador las muestra en listas separadas para que puedas corregirlas una a una.
Qué puede y qué no puede comprobar esta herramienta
Todo se basa en el texto que pegas. Puede comprobar que el XML sea válido, que las URL estén bien formadas, sean coherentes y estén permitidas por robots.txt. No puede saber si cada página responde actualmente con 200 o tiene una etiqueta noindex, porque para eso tendría que visitarla. El informe marca esos datos como «no comprobados» en vez de adivinarlos.