Generador gratis de robots.txt: permitir, bloquear y bots de IA | We.Inc
Crea gratis un robots.txt: permite o bloquea rastreadores, excluye carpetas, añade tu sitemap y decide si rastreadores de IA como GPTBot pueden leer el sitio.
Crea un archivo robots.txt correcto en un minuto: elige una regla predeterminada para todos los rastreadores, enumera las carpetas que quieres excluir, añade tu sitemap y decide si los rastreadores de IA pueden leer tu contenido. Copia el resultado o descárgalo como archivo.
Elige la regla predeterminada para todos los rastreadores: permitir todo (la mayoría de los sitios) o bloquear todo (sitios de prueba).
Añade las carpetas a las que no quieres que accedan los rastreadores, una por línea, como /admin/ o /cart/.
Pega la dirección de tu sitemap para que los motores de búsqueda encuentren todas las páginas.
Si quieres, bloquea los rastreadores de entrenamiento de IA. Luego copia o descarga robots.txt y súbelo a la raíz de tu dominio.
robots.txt debe estar exactamente en tudominio.com/robots.txt. En cualquier otra ubicación se ignora.
Bloquear una página en robots.txt no la elimina de Google. Para excluirla de los resultados, usa una etiqueta noindex y permite que se rastree.
No bloquees las carpetas de CSS ni JavaScript: Google las necesita para ver bien tu página.
Después de subirlo, comprueba el archivo activo abriéndolo en el navegador.
Preguntas frecuentes
¿Qué hace robots.txt?
Indica a los rastreadores que respetan las reglas qué partes de tu sitio pueden solicitar. Es una petición, no un bloqueo: no protege contenido privado y los bots maliciosos lo ignoran.
¿Necesito un archivo robots.txt?
No es obligatorio. Si no hay uno, los rastreadores suponen que pueden recorrer todo. Aun así, resulta útil para indicar el sitemap y excluir páginas como carritos y paneles de administración.
¿Debería bloquear los rastreadores de IA?
Es una decisión comercial. Bloquear GPTBot, ClaudeBot, Google-Extended y otros rastreadores similares les pide que no usen tu contenido para entrenamiento, pero también puede reducir lo que los asistentes de IA saben sobre tu negocio. Muchos pequeños negocios los permiten para que las respuestas de IA puedan recomendarlos.
¿Cuánto tardan en aplicarse los cambios?
Google suele volver a leer robots.txt en un día. Puedes pedir una actualización en el informe de robots.txt de Google Search Console.
¿Cómo puedo comprobar si una URL está bloqueada por robots.txt?
Usa el probador de esta página. Pega tu robots.txt (o usa el que acabas de generar), introduce la dirección y el nombre del rastreador, por ejemplo Googlebot, y te mostrará Permitido o Bloqueado junto con la regla exacta que tomó la decisión. Aplica las reglas de coincidencia de Google en tu navegador y no obtiene tu archivo activo, así que pega la versión actual de tudominio.com/robots.txt.
Si una regla Allow y una Disallow coinciden, ¿cuál tiene prioridad?
Para Google, gana la regla con la ruta más larga porque es más específica. Si ambas rutas tienen la misma longitud, gana Allow. Otros rastreadores pueden resolver los conflictos de forma distinta, así que evita depender de empates.
Cómo se leen las reglas de robots.txt
Un archivo robots.txt contiene grupos. Cada uno empieza con una o varias líneas User-agent que nombran un rastreador (o * para todos), seguidas de líneas Allow y Disallow con rutas URL. El rastreador usa el grupo más específico que lo nombra y, dentro del grupo, gana la ruta coincidente más larga.
«Disallow: /» bloquea todo. «Disallow:» vacío permite todo. «Disallow: /admin/» bloquea todas las direcciones que empiezan por /admin/. Las rutas distinguen mayúsculas de minúsculas.
Una configuración predeterminada sensata para un pequeño negocio
Permite todo, bloquea las carpetas de administración, carrito, pago o cuenta que use tu plataforma e indica el sitemap. Eso es suficiente para la mayoría de los sitios. No uses robots.txt para ocultar páginas de agradecimiento o duplicadas a Google; para eso está la etiqueta noindex.
Todos los sitios publicados con We.Inc ya ofrecen robots.txt y un sitemap automáticamente, así que solo necesitas este generador para sitios alojados en otro lugar.
Probar una URL antes de subir el archivo
Un pequeño error en robots.txt puede bloquear toda una sección de un sitio, así que prueba las direcciones que importan antes de subirlo: tu página de inicio, una página de producto o servicio, una entrada del blog y cualquier cosa que hayas querido bloquear. Introduce cada una en el probador con el rastreador que te interese, normalmente Googlebot, y comprueba que el resultado y la regla que lo decidió son los esperados.
Los comodines son donde aparecen la mayoría de las sorpresas. «Disallow: /*?sort=» bloquea cualquier dirección que contenga ?sort=, y «Disallow: /*.pdf$» bloquea las direcciones que terminan en .pdf pero no /archivo.pdf?descarga=1. Recuerda también que un rastreador nombrado en su propio grupo, como Googlebot-Image, ignora el grupo * por completo, así que las reglas que escribiste para todos no se aplican a él.