Verificador de sitemap: encontre páginas faltantes e conflitantes
Verificador de sitemap
Verificador de sitemap: valide o XML e encontre páginas faltantes | We.Inc
Cole seu sitemap.xml para validar o XML, encontrar URLs duplicadas, em http, de outro domínio ou com datas erradas, compará-lo com as páginas que você espera e com o robots.txt, e baixar os resultados em CSV.
Abra seu sitemap (geralmente seusite.com/sitemap.xml), copie e cole aqui, ou envie o arquivo. O verificador valida o XML e cada URL dele e depois o compara com uma lista das páginas que você espera e com o seu robots.txt, para você ver o que falta, o que não deveria estar lá e o que entra em conflito. Ele não visita o seu site: os navegadores impedem que um site leia outro, então ele verifica o que você cola. Tudo roda no seu navegador. Nada do que você digita vai para a We.Inc ou para qualquer outra pessoa, e tudo some quando você fecha a aba.
Cole o conteúdo do seu sitemap.xml ou envie o arquivo (até 10 MB). Arquivos de índice de sitemap também são reconhecidos; o verificador lista os sitemaps filhos para você colar um por um.
O XML é analisado no seu navegador. Você vê se ele é válido, se usa o namespace padrão de sitemap e quantas URLs ele tem em relação aos limites de 50.000 URLs e 50 MB.
Cada URL é verificada: endereço https completo, mesmo host das demais, sem fragmento #, sem parâmetros de rastreamento, sem duplicatas e com uma data lastmod válida que não esteja no futuro.
Se quiser, cole as páginas que você espera ver listadas, como os links do seu menu. O relatório mostra as páginas esperadas que faltam no sitemap e as páginas do sitemap que você não esperava.
Se quiser, cole seu robots.txt. O verificador sinaliza URLs do sitemap bloqueadas pelo robots.txt e avisa se o robots.txt não aponta para um sitemap.
Baixe os resultados em CSV. Para o código de status, a canonical e o noindex de uma URL específica, rode o comando curl mostrado na página.
Liste só as páginas que você quer nos resultados de busca: endereços https finais que respondem 200, não são redirecionados e são a própria canonical.
Remova páginas com noindex. Um sitemap que lista páginas que você pede para os buscadores não indexarem manda sinais contraditórios.
Só use lastmod quando souber a data em que a página realmente mudou. Colocar a data de hoje em todas as páginas ensina os buscadores a ignorar o campo.
Adicione ao robots.txt uma linha Sitemap: com o endereço completo, para que os rastreadores encontrem o sitemap sem precisar ser avisados.
Envie o sitemap no Google Search Console e no Bing Webmaster Tools e depois confira nos relatórios deles as páginas que não conseguiram buscar.
Perguntas frequentes
Este verificador de sitemap rastreia o meu site?
Não. Uma página da web não consegue ler os arquivos de outro site porque os navegadores bloqueiam, e não usamos um rastreador escondido. Você cola o sitemap, a lista de páginas e o robots.txt, e as verificações rodam sobre esse texto. O relatório diz exatamente quantas URLs foram verificadas.
Como verifico códigos de status, canonicals e noindex?
Rode curl -sIL seguido do endereço da página em um terminal para ver o código de status e os redirecionamentos. Para ver a canonical e a meta tag robots, rode curl -sL seguido do endereço e procure rel="canonical" e name="robots" na saída. O relatório de indexação de páginas do Search Console mostra as mesmas evidências para o site inteiro.
Quais são os limites de um sitemap?
Um arquivo de sitemap pode ter até 50.000 URLs e até 50 MB sem compactação. Sites maiores dividem suas URLs em vários sitemaps listados em um arquivo de índice de sitemap.
Por que URLs em http ou de outro domínio são sinalizadas?
Um sitemap deve listar os endereços finais no mesmo site onde o sitemap está. Endereços http em um site https redirecionam, e URLs em outro host são ignoradas pelos buscadores, a não ser que você tenha verificado o envio entre sites.
Um sitemap válido significa que minhas páginas serão indexadas?
Não. O sitemap ajuda os buscadores a encontrar as páginas; ele não os faz indexar nem ranquear essas páginas. Qualidade, links e sinais técnicos continuam decidindo isso.
O que eu colo fica armazenado?
Não. A verificação roda no seu navegador e nada é enviado a lugar nenhum.
Páginas faltantes e páginas que não deveriam estar listadas
Dois tipos de erro importam. Páginas faltantes são páginas reais que você quer que sejam encontradas e que o sitemap deixa de fora, muitas vezes páginas de serviço ou posts do blog criados depois do sitemap. Páginas indesejadas são endereços que nem deveriam estar lá: redirecionamentos, páginas de teste, versões filtradas da mesma página ou páginas marcadas com noindex.
Comparar o sitemap com uma lista confiável, como os links do seu menu e rodapé, é o jeito mais rápido de encontrar os dois. Este verificador os mantém em listas separadas para você corrigir um de cada vez.
O que esta verificação consegue e não consegue ver
Tudo aqui se baseia no texto que você cola. Ela consegue provar que o XML é válido e que as URLs estão bem formadas, consistentes e liberadas pelo seu robots.txt. Ela não consegue ver se cada página responde 200 agora ou tem uma tag noindex, porque isso exige visitar cada página. O relatório marca esses itens como não verificados em vez de adivinhar.