Generatore Gratuito di Robots.txt: Allow, Disallow e Bot IA | We.Inc
Generatore gratuito di robots.txt: consenti o blocca tutti i crawler, disallow cartelle, aggiungi la tua sitemap e scegli se i crawler IA come GPTBot possono leggere il tuo sito.
Costruisci un file robots.txt corretto in un minuto: scegli un predefinito per tutti i crawler, elenca le cartelle da tenere fuori, aggiungi la tua sitemap, e decidi se i crawler IA possono leggere il tuo contenuto. Copia il risultato o scaricalo come file.
Scegli la regola predefinita per tutti i crawler: consenti tutto (la maggior parte dei siti) o blocca tutto (siti di staging).
Aggiungi qualsiasi cartella da tenere fuori dai crawler, una per riga, come /admin/ o /cart/.
Incolla l'indirizzo della tua sitemap così i motori di ricerca possono trovare ogni pagina.
Opzionalmente blocca i crawler di addestramento IA. Poi copia o scarica robots.txt e caricalo nella radice del tuo dominio.
robots.txt deve trovarsi esattamente a tuodominio.com/robots.txt. Ovunque altro viene ignorato.
Bloccare una pagina in robots.txt non la rimuove da Google. Per tenere una pagina fuori dai risultati, usa un tag noindex e lasciala scansionare.
Non bloccare mai le tue cartelle CSS o JavaScript; Google ne ha bisogno per vedere correttamente la tua pagina.
Controlla il file live dopo il caricamento aprendolo nel tuo browser.
Domande frequenti
Cosa fa robots.txt?
Dice ai crawler ben educati quali parti del tuo sito possono richiedere. È una richiesta, non un lucchetto: non protegge contenuto privato, e i bot malintenzionati lo ignorano.
Mi serve un file robots.txt?
Non strettamente. Senza uno, i crawler assumono di poter scansionare tutto. Averne uno è comunque utile per indicare la tua sitemap e per tenere i crawler fuori da pagine come carrelli e schermate di amministrazione.
Dovrei bloccare i crawler IA?
È una scelta aziendale. Bloccare GPTBot, ClaudeBot, Google-Extended e crawler simili chiede loro di non usare il tuo contenuto per l'addestramento, ma può anche significare che gli assistenti IA sanno meno della tua attività. Molte piccole imprese li lasciano consentiti così le risposte IA possono raccomandarle.
Quanto tempo ci vuole prima che i cambiamenti abbiano effetto?
Google di solito rilegge robots.txt entro un giorno. Puoi chiedere un aggiornamento nel report robots.txt in Google Search Console.
Come verifico se un URL è bloccato da robots.txt?
Usa il tester su questa pagina. Incolla il tuo robots.txt (o usa quello appena generato), inserisci l'indirizzo e il nome del crawler, come Googlebot, e ti mostra Consentito o Bloccato con la regola esatta che ha deciso. Applica le regole di corrispondenza di Google nel tuo browser e non recupera il file live, quindi incolla la versione attuale da tuodominio.com/robots.txt.
Se corrispondono sia una regola Allow che una Disallow, quale vince?
Per Google, vince la regola con il percorso più lungo, perché è più specifica. Se entrambi i percorsi hanno la stessa lunghezza, vince Allow. Altri crawler potrebbero risolvere i conflitti diversamente, quindi evita di fare affidamento sui pareggi.
Come sono lette le regole di robots.txt
Un file robots.txt è una lista di gruppi. Ogni gruppo inizia con una o più righe User-agent che nominano un crawler (o * per tutti), seguite da righe Allow e Disallow con percorsi URL. Un crawler usa il gruppo più specifico che lo nomina, e dentro un gruppo il percorso corrispondente più lungo vince.
'Disallow: /' blocca tutto. Un 'Disallow:' vuoto consente tutto. 'Disallow: /admin/' blocca ogni indirizzo che inizia con /admin/. I percorsi distinguono maiuscole e minuscole.
Un predefinito sensato per il sito di una piccola impresa
Consenti tutto, blocca qualsiasi cartella admin, carrello, checkout o account che usa la tua piattaforma, e elenca la tua sitemap. È tutto ciò di cui ha bisogno la maggior parte dei siti. Non usare robots.txt per nascondere pagine di ringraziamento o pagine duplicate da Google; un tag noindex fa quel lavoro correttamente.
Ogni sito pubblicato con We.Inc già serve un robots.txt e una sitemap automaticamente, quindi ti serve questo generatore solo per siti ospitati altrove.
Testare un URL prima di caricare
Un piccolo errore in robots.txt può bloccare un'intera sezione del sito, quindi testa gli indirizzi importanti prima di caricare: la tua homepage, una pagina prodotto o servizio, un post del blog, e tutto ciò che intendi bloccare. Inserisci ciascuno nel tester con il crawler che ti interessa, di solito Googlebot, e verifica che il risultato e la regola decisiva siano quelli attesi.
I caratteri jolly sono la fonte più comune di sorprese. 'Disallow: /*?sort=' blocca qualsiasi indirizzo che contiene ?sort=, e 'Disallow: /*.pdf$' blocca gli indirizzi che terminano con .pdf ma non /file.pdf?download=1. Ricorda inoltre che un crawler nominato nel suo gruppo specifico, come Googlebot-Image, ignora completamente il gruppo *, quindi le regole scritte per tutti non si applicano ad esso.