Générateur robots.txt gratuit : Allow, Disallow, bots IA | We.Inc
Générateur robots.txt gratuit : autorisez ou bloquez tous les robots, interdisez des dossiers, ajoutez votre sitemap et choisissez si les robots IA comme GPTBot peuvent lire votre site.
Construisez un fichier robots.txt correct en une minute : choisissez une règle par défaut pour tous les robots, listez les dossiers à protéger, ajoutez votre sitemap, et décidez si les robots IA peuvent lire votre contenu. Copiez le résultat ou téléchargez-le en fichier.
Choisissez la règle par défaut pour tous les robots : tout autoriser (la plupart des sites) ou tout bloquer (sites de staging).
Ajoutez les dossiers à protéger des robots, un par ligne, comme /admin/ ou /cart/.
Collez l'adresse de votre sitemap pour que les moteurs de recherche trouvent chaque page.
Bloquez éventuellement les robots d'entraînement IA. Puis copiez ou téléchargez robots.txt et importez-le à la racine de votre domaine.
robots.txt doit se trouver exactement à votredomaine.com/robots.txt. Ailleurs, il est ignoré.
Bloquer une page dans robots.txt ne la retire pas de Google. Pour garder une page hors des résultats, utilisez une balise noindex et laissez-la être explorée.
Ne bloquez jamais vos dossiers CSS ou JavaScript ; Google en a besoin pour voir votre page correctement.
Vérifiez le fichier en ligne après l'import en l'ouvrant dans votre navigateur.
Questions fréquentes
Que fait robots.txt ?
Il dit aux robots bien élevés quelles parties de votre site ils peuvent demander. C'est une requête, pas un verrou : cela ne protège pas le contenu privé, et les mauvais robots l'ignorent.
Ai-je besoin d'un fichier robots.txt ?
Pas strictement. Sans lui, les robots supposent qu'ils peuvent tout explorer. En avoir un reste utile pour pointer vers votre sitemap et garder les robots hors des pages comme les paniers et écrans d'administration.
Devrais-je bloquer les robots IA ?
C'est un choix d'entreprise. Bloquer GPTBot, ClaudeBot, Google-Extended et robots similaires leur demande de ne pas utiliser votre contenu pour l'entraînement, mais peut aussi signifier que les assistants IA en savent moins sur votre entreprise. Beaucoup de petites entreprises les laissent autorisés pour que les réponses IA puissent les recommander.
Combien de temps avant que les changements prennent effet ?
Google relit généralement robots.txt dans la journée. Vous pouvez demander une actualisation dans le rapport robots.txt de Google Search Console.
Comment tester si une URL est bloquée par robots.txt ?
Utilisez le testeur sur cette page. Collez votre robots.txt (ou utilisez celui que vous venez de générer), entrez l'adresse et le nom du robot, par exemple Googlebot, et il affiche Autorisé ou Bloqué avec la règle exacte qui a décidé. Il applique les règles de correspondance de Google dans votre navigateur et ne récupère pas votre fichier en ligne, donc collez la version actuelle depuis votredomaine.com/robots.txt.
Si une règle Allow et une règle Disallow correspondent toutes les deux, laquelle l'emporte ?
Pour Google, la règle avec le chemin le plus long l'emporte, car elle est plus spécifique. Si les deux chemins ont la même longueur, Allow l'emporte. D'autres robots peuvent résoudre les conflits différemment, évitez donc de compter sur les égalités.
Comment les règles robots.txt sont lues
Un fichier robots.txt est une liste de groupes. Chaque groupe commence par une ou plusieurs lignes User-agent nommant un robot (ou * pour tous), suivies de lignes Allow et Disallow avec des chemins d'URL. Un robot utilise le groupe le plus spécifique qui le nomme, et dans un groupe, le chemin correspondant le plus long l'emporte.
« Disallow: / » bloque tout. Un « Disallow: » vide autorise tout. « Disallow: /admin/ » bloque chaque adresse commençant par /admin/. Les chemins sont sensibles à la casse.
Un réglage par défaut sensé pour un site de petite entreprise
Autorisez tout, bloquez les dossiers admin, panier, paiement ou compte que votre plateforme utilise, et listez votre sitemap. C'est tout ce dont la plupart des sites ont besoin. N'utilisez pas robots.txt pour cacher des pages de remerciement ou des pages en double à Google ; une balise noindex fait ce travail correctement.
Chaque site publié avec We.Inc sert déjà un robots.txt et un sitemap automatiquement, vous n'avez donc besoin de ce générateur que pour des sites hébergés ailleurs.
Tester une URL avant de la mettre en ligne
Une petite erreur dans robots.txt peut bloquer toute une section d'un site, donc testez les adresses qui comptent avant de mettre le fichier en ligne : votre page d'accueil, une page de produit ou service, un article de blog, et tout ce que vous vouliez bloquer. Entrez chacune dans le testeur avec le robot qui vous intéresse, généralement Googlebot, et vérifiez que le résultat et la règle décisive correspondent à ce que vous attendez.
Les caractères génériques sont la principale source de surprises. « Disallow: /*?sort= » bloque toute adresse contenant ?sort=, et « Disallow: /*.pdf$ » bloque les adresses se terminant par .pdf mais pas /fichier.pdf?download=1. Souvenez-vous aussi qu'un robot nommé dans son propre groupe, comme Googlebot-Image, ignore complètement le groupe *, donc les règles que vous avez écrites pour tous ne lui s'appliquent pas.