Gerador de robots.txt grátis: Allow, Disallow e robôs de IA | We.Inc
Gerador de robots.txt grátis: libere ou bloqueie todos os rastreadores, bloqueie pastas, adicione seu sitemap e decida se rastreadores de IA como o GPTBot podem ler seu site.
Crie um arquivo robots.txt correto em um minuto: escolha uma regra padrão para todos os rastreadores, liste as pastas que devem ficar de fora, adicione seu sitemap e decida se os rastreadores de IA podem ler o seu conteúdo. Copie o resultado ou baixe como arquivo.
Escolha a regra padrão para todos os rastreadores: liberar tudo (a maioria dos sites) ou bloquear tudo (sites de homologação).
Adicione as pastas que os rastreadores não devem acessar, uma por linha, como /admin/ ou /cart/.
Cole o endereço do seu sitemap para que os buscadores encontrem todas as páginas.
Se quiser, bloqueie os rastreadores de treinamento de IA. Depois copie ou baixe o robots.txt e envie para a raiz do seu domínio.
O robots.txt precisa ficar exatamente em seudominio.com/robots.txt. Em qualquer outro lugar ele é ignorado.
Bloquear uma página no robots.txt não a remove do Google. Para manter uma página fora dos resultados, use uma tag noindex e deixe que ela seja rastreada.
Nunca bloqueie as pastas de CSS ou JavaScript; o Google precisa delas para ver sua página direito.
Confira o arquivo no ar depois de enviar, abrindo-o no navegador.
Perguntas frequentes
O que o robots.txt faz?
Ele diz aos rastreadores bem-comportados quais partes do seu site eles podem acessar. É um pedido, não uma tranca: não protege conteúdo privado, e robôs mal-intencionados o ignoram.
Preciso de um arquivo robots.txt?
Não obrigatoriamente. Sem ele, os rastreadores entendem que podem rastrear tudo. Mesmo assim, ter um é útil para indicar seu sitemap e manter os rastreadores fora de páginas como carrinho e telas de administração.
Devo bloquear os rastreadores de IA?
É uma decisão de negócio. Bloquear o GPTBot, o ClaudeBot, o Google-Extended e rastreadores parecidos pede que eles não usem seu conteúdo para treinamento, mas também pode fazer com que os assistentes de IA saibam menos sobre o seu negócio. Muitas pequenas empresas os deixam liberados para que as respostas de IA possam recomendá-las.
Quanto tempo leva para as mudanças valerem?
O Google costuma reler o robots.txt em até um dia. Você pode pedir uma atualização no relatório de robots.txt do Google Search Console.
Como testar se uma URL está bloqueada pelo robots.txt?
Use o testador nesta página. Cole o seu robots.txt (ou use o que você acabou de gerar), insira o endereço e o nome do rastreador, como Googlebot, e ele mostra Permitido ou Bloqueado com a regra exata que decidiu. Ele aplica as regras de correspondência do Google no seu navegador e não busca o arquivo ao vivo, então cole a versão atual de seudominio.com/robots.txt.
Se uma regra Allow e uma Disallow correspondem, qual vence?
Para o Google, a regra com o caminho mais longo vence, por ser mais específica. Se os dois caminhos tiverem o mesmo tamanho, Allow vence. Outros rastreadores podem resolver conflitos de forma diferente, então evite depender de empates.
Como as regras do robots.txt são lidas
Um arquivo robots.txt é uma lista de grupos. Cada grupo começa com uma ou mais linhas User-agent que nomeiam um rastreador (ou * para todos), seguidas de linhas Allow e Disallow com caminhos de URL. Um rastreador usa o grupo mais específico que o nomeia e, dentro de um grupo, vence o caminho correspondente mais longo.
'Disallow: /' bloqueia tudo. Um 'Disallow:' vazio libera tudo. 'Disallow: /admin/' bloqueia todo endereço que começa com /admin/. Os caminhos diferenciam maiúsculas de minúsculas.
Um padrão sensato para o site de uma pequena empresa
Libere tudo, bloqueie as pastas de administração, carrinho, checkout ou conta que a sua plataforma usa e indique seu sitemap. É tudo de que a maioria dos sites precisa. Não use o robots.txt para esconder do Google páginas de agradecimento ou páginas duplicadas; uma tag noindex faz esse trabalho direito.
Todo site publicado com a We.Inc já serve um robots.txt e um sitemap automaticamente, então você só precisa deste gerador para sites hospedados em outro lugar.
Testar uma URL antes de enviar
Um pequeno erro no robots.txt pode bloquear uma seção inteira de um site, então teste os endereços que importam antes de enviar: a sua página inicial, uma página de produto ou serviço, um post de blog e tudo o que você quis bloquear. Insira cada um no testador com o rastreador que você se preocupa, geralmente o Googlebot, e verifique se o resultado e a regra decisiva são o que você espera.
Os curingas são onde a maioria das surpresas vem. 'Disallow: /*?sort=' bloqueia qualquer endereço que contenha ?sort=, e 'Disallow: /*.pdf$' bloqueia endereços que terminam em .pdf, mas não /arquivo.pdf?download=1. Lembre também que um rastreador nomeado em seu próprio grupo, como o Googlebot-Image, ignora o grupo * completamente, então regras que você escreveu para todos não se aplicam a ele.