Kostenloser Robots.txt-Generator: Crawler und KI-Bots steuern | We.Inc
Kostenloser Robots.txt-Generator: Crawler erlauben oder blockieren, Ordner ausschließen, Sitemap ergänzen und festlegen, ob KI-Crawler wie GPTBot Ihre Website lesen dürfen.
Erstellen Sie in einer Minute eine passende robots.txt-Datei: Legen Sie eine Standardregel für alle Crawler fest, schließen Sie bestimmte Ordner aus, fügen Sie Ihre Sitemap hinzu und entscheiden Sie, ob KI-Crawler Ihre Inhalte lesen dürfen. Kopieren Sie das Ergebnis oder laden Sie die Datei herunter.
Wählen Sie die Standardregel für alle Crawler: alles erlauben (für die meisten Websites) oder alles blockieren (für Staging-Websites).
Führen Sie Ordner, von denen Sie Crawler fernhalten möchten, zeilenweise auf, zum Beispiel /admin/ oder /cart/.
Fügen Sie die Adresse Ihrer Sitemap ein, damit Suchmaschinen alle Seiten finden können.
Blockieren Sie bei Bedarf KI-Trainingscrawler. Kopieren Sie anschließend die robots.txt-Datei oder laden Sie sie herunter und legen Sie sie im Stammverzeichnis Ihrer Domain ab.
Die Datei robots.txt muss genau unter ihrerdomain.com/robots.txt liegen. Andere Speicherorte werden ignoriert.
Eine Seite in robots.txt zu blockieren, entfernt sie nicht aus Google. Damit sie nicht in den Suchergebnissen erscheint, verwenden Sie ein noindex-Tag und lassen Sie die Seite crawlen.
Blockieren Sie niemals Ihre CSS- oder JavaScript-Ordner. Google benötigt sie, um Ihre Seite korrekt darzustellen.
Prüfen Sie die Live-Datei nach dem Hochladen, indem Sie sie im Browser öffnen.
Häufige Fragen
Wozu dient robots.txt?
Die Datei teilt gutartige Crawlern mit, welche Bereiche Ihrer Website sie abrufen dürfen. Sie ist eine Bitte, keine Sperre: Private Inhalte werden dadurch nicht geschützt, und schädliche Bots ignorieren die Regeln.
Brauche ich eine robots.txt-Datei?
Zwingend erforderlich ist sie nicht. Fehlt die Datei, gehen Crawler davon aus, dass sie alles crawlen dürfen. Trotzdem ist sie hilfreich, um auf Ihre Sitemap zu verweisen und Crawler von Warenkörben oder Admin-Bereichen fernzuhalten.
Sollte ich KI-Crawler blockieren?
Das ist eine geschäftliche Entscheidung. Wenn Sie GPTBot, ClaudeBot, Google-Extended und ähnliche Crawler blockieren, bitten Sie sie, Ihre Inhalte nicht zum Training zu verwenden. KI-Assistenten wissen dann möglicherweise weniger über Ihr Unternehmen. Viele kleine Unternehmen lassen diese Crawler zu, damit KI-Antworten sie empfehlen können.
Wie lange dauert es, bis Änderungen wirksam werden?
Google liest robots.txt normalerweise innerhalb eines Tages erneut ein. Im robots.txt-Bericht der Google Search Console können Sie eine Aktualisierung anfordern.
Wie teste ich, ob eine URL von robots.txt gesperrt wird?
Verwenden Sie den Tester auf dieser Seite. Fügen Sie Ihre robots.txt ein (oder nutzen Sie die soeben erstellte), geben Sie die Adresse und den Crawler-Namen ein – z. B. Googlebot – und er zeigt Erlaubt oder Gesperrt zusammen mit der genauen Regel an, die entschieden hat. Der Tester wendet Googles Matching-Regeln im Browser an und ruft Ihre Live-Datei nicht ab. Fügen Sie daher die aktuelle Version von ihredomain.de/robots.txt ein.
Wenn sowohl eine Allow- als auch eine Disallow-Regel zutrifft, welche gewinnt?
Bei Google gewinnt die Regel mit dem längeren Pfad, weil sie spezifischer ist. Sind beide Pfade gleich lang, gewinnt Allow. Andere Crawler können Konflikte anders auflösen – verlassen Sie sich daher nicht auf Gleichstände.
So werden robots.txt-Regeln ausgewertet
Eine robots.txt-Datei besteht aus Gruppen. Jede Gruppe beginnt mit einer oder mehreren User-agent-Zeilen, die einen Crawler (oder * für alle) nennen. Danach folgen Allow- und Disallow-Zeilen mit URL-Pfaden. Ein Crawler verwendet die spezifischste Gruppe, die ihn nennt. Innerhalb einer Gruppe gilt der längste passende Pfad.
„Disallow: /“ blockiert alles. Ein leeres „Disallow:“ erlaubt alles. „Disallow: /admin/“ blockiert jede Adresse, die mit /admin/ beginnt. Bei Pfaden wird zwischen Groß- und Kleinschreibung unterschieden.
Eine sinnvolle Voreinstellung für kleine Unternehmen
Erlauben Sie alles, schließen Sie die Admin-, Warenkorb-, Checkout- oder Kontobereiche Ihrer Plattform aus und führen Sie Ihre Sitemap auf. Für die meisten Websites reicht das. Verwenden Sie robots.txt nicht, um Dankeseiten oder doppelte Seiten vor Google zu verbergen; dafür ist ein noindex-Tag gedacht.
Jede mit We.Inc veröffentlichte Website stellt bereits automatisch eine robots.txt-Datei und eine Sitemap bereit. Diesen Generator benötigen Sie daher nur für Websites, die anderswo gehostet werden.
Eine URL testen, bevor Sie hochladen
Ein kleiner Fehler in der robots.txt kann einen ganzen Bereich einer Website sperren. Testen Sie daher die wichtigen Adressen, bevor Sie hochladen: Ihre Startseite, eine Produkt- oder Dienstleistungsseite, einen Blogbeitrag und alles, was Sie blockieren wollten. Geben Sie jede Adresse im Tester mit dem Crawler ein, um den es Ihnen geht – in der Regel Googlebot – und prüfen Sie, ob Ergebnis und entscheidende Regel Ihren Erwartungen entsprechen.
Wildcards sind die häufigste Fehlerquelle. „Disallow: /*?sort=“ sperrt jede Adresse, die ?sort= enthält, und „Disallow: /*.pdf$“ sperrt Adressen, die auf .pdf enden, aber nicht /datei.pdf?download=1. Denken Sie auch daran: Ein Crawler, der in einer eigenen Gruppe aufgeführt ist – z. B. Googlebot-Image –, ignoriert die *-Gruppe vollständig. Regeln, die Sie für alle geschrieben haben, gelten also nicht für ihn.