Darmowy generator robots.txt: Allow, Disallow i boty AI | We.Inc
Darmowy generator robots.txt: zezwól lub zablokuj wszystkie roboty, wyłącz foldery, dodaj mapę witryny i wybierz, czy roboty AI, takie jak GPTBot, mogą czytać Twoją stronę.
Zbuduj poprawny plik robots.txt w minutę: wybierz domyślną regułę dla wszystkich robotów, wypisz foldery do wykluczenia, dodaj mapę witryny i zdecyduj, czy roboty AI mogą czytać Twoje treści. Skopiuj wynik lub pobierz go jako plik.
Wybierz domyślną regułę dla wszystkich robotów: zezwól na wszystko (większość stron) lub zablokuj wszystko (strony testowe).
Dodaj foldery, do których roboty nie mają wchodzić, po jednym w wierszu, takie jak /admin/ lub /cart/.
Wklej adres mapy witryny, aby wyszukiwarki mogły znaleźć każdą stronę.
Opcjonalnie zablokuj roboty AI zbierające dane do trenowania. Następnie skopiuj lub pobierz robots.txt i wgraj go do katalogu głównego swojej domeny.
robots.txt musi znajdować się dokładnie pod adresem yourdomain.com/robots.txt. Gdziekolwiek indziej jest ignorowany.
Zablokowanie strony w robots.txt nie usuwa jej z Google. Aby wykluczyć stronę z wyników, użyj znacznika noindex i pozwól ją skanować.
Nigdy nie blokuj folderów CSS ani JavaScript; Google potrzebuje ich, by poprawnie zobaczyć Twoją stronę.
Sprawdź działający plik po wgraniu, otwierając go w przeglądarce.
Najczęściej zadawane pytania
Do czego służy robots.txt?
Mówi dobrze zachowującym się robotom, o które części Twojej strony mogą prosić. To prośba, a nie zamek: nie chroni prywatnych treści, a złe boty go ignorują.
Czy potrzebuję pliku robots.txt?
Nie koniecznie. Bez niego roboty zakładają, że mogą skanować wszystko. Mimo to przydaje się, by wskazać mapę witryny i trzymać roboty z dala od stron takich jak koszyki i ekrany administracyjne.
Czy powinienem blokować roboty AI?
To decyzja biznesowa. Blokowanie GPTBot, ClaudeBot, Google-Extended i podobnych robotów prosi je o niewykorzystywanie Twoich treści do trenowania, ale może też oznaczać, że asystenci AI wiedzą mniej o Twojej firmie. Wiele małych firm zostawia je dopuszczone, aby odpowiedzi AI mogły je polecać.
Jak długo trzeba czekać na wejście zmian w życie?
Google zwykle ponownie czyta robots.txt w ciągu dnia. Możesz poprosić o odświeżenie w raporcie robots.txt w Google Search Console.
Jak sprawdzić, czy adres URL jest zablokowany przez robots.txt?
Użyj testera na tej stronie. Wklej swój robots.txt (lub użyj wygenerowanego właśnie), wpisz adres i nazwę robota, na przykład Googlebot, a narzędzie pokaże Dozwolony lub Zablokowany wraz z regułą, która o tym zadecydowała. Stosuje reguły dopasowania Google w Twojej przeglądarce i nie pobiera Twojego pliku na żywo, więc wklej aktualną wersję z yourdomain.com/robots.txt.
Jeśli pasują zarówno reguła Allow, jak i Disallow, która wygrywa?
W Google wygrywa reguła z dłuższą ścieżką, bo jest bardziej szczegółowa. Jeśli obie ścieżki mają tę samą długość, wygrywa Allow. Inne roboty mogą inaczej rozwiązywać konflikty, więc unikaj polegania na remisach.
Jak czytane są reguły robots.txt
Plik robots.txt to lista grup. Każda grupa zaczyna się od jednego lub kilku wierszy User-agent nazywających robota (lub * dla wszystkich), po których następują wiersze Allow i Disallow ze ścieżkami URL. Robot używa najbardziej szczegółowej grupy, która go nazywa, a w obrębie grupy wygrywa najdłuższa pasująca ścieżka.
'Disallow: /' blokuje wszystko. Pusty 'Disallow:' zezwala na wszystko. 'Disallow: /admin/' blokuje każdy adres zaczynający się od /admin/. Ścieżki uwzględniają wielkość liter.
Rozsądna wartość domyślna dla strony małej firmy
Zezwól na wszystko, zablokuj foldery administracyjne, koszyka, kasy i konta, których używa Twoja platforma, i wymień mapę witryny. To wszystko, czego potrzebuje większość stron. Nie używaj robots.txt do ukrywania stron z podziękowaniami ani duplikatów przed Google; ten zadanie właściwie wykonuje znacznik noindex.
Każda strona opublikowana w We.Inc automatycznie udostępnia już robots.txt i mapę witryny, więc ten generator jest potrzebny tylko dla stron hostowanych gdzie indziej.
Testowanie adresu URL przed wgraniem
Mały błąd w robots.txt może zablokować całą sekcję strony, więc przetestuj ważne adresy przed wgraniem: stronę główną, stronę produktu lub usługi, wpis blogowy i wszystko, co chciałeś zablokować. Wpisz każdy z nich w testerze z robotem, na którym Ci zależy, zwykle Googlebot, i sprawdź, czy wynik i decydująca reguła są zgodne z oczekiwaniami.
Większość niespodzianek pochodzi z wieloznaczników. 'Disallow: /*?sort=' blokuje każdy adres zawierający ?sort=, a 'Disallow: /*.pdf$' blokuje adresy kończące się na .pdf, ale nie /file.pdf?download=1. Pamiętaj też, że robot nazwany we własnej grupie, na przykład Googlebot-Image, całkowicie ignoruje grupę *, więc reguły napisane dla wszystkich nie dotyczą go.