Створіть robots.txt: дозвольте чи заблокуйте сканери, закрийте папки, додайте sitemap і вирішіть, чи можуть GPTBot та інші боти ШІ читати ваш сайт.
Створіть правильний файл robots.txt за хвилину: виберіть стандартне правило для всіх сканерів, укажіть закриті папки, додайте sitemap і вирішіть, чи можуть боти ШІ читати ваш контент. Скопіюйте результат або завантажте його файлом.
Виберіть стандартне правило для всіх сканерів: дозволити все (для більшості сайтів) або заблокувати все (для тестових сайтів).
Додайте папки, доступ до яких сканерам потрібно заборонити, по одній у рядку, наприклад /admin/ або /cart/.
Вставте адресу sitemap, щоб пошукові системи могли знайти всі сторінки.
За бажанням заблокуйте ботів, які сканують сайти для навчання ШІ. Потім скопіюйте або завантажте robots.txt і додайте його в кореневу папку домену.
Файл robots.txt має бути саме за адресою yourdomain.com/robots.txt. В іншому місці його буде проігноровано.
Блокування сторінки у robots.txt не вилучає її з Google. Щоб прибрати сторінку з результатів, використайте тег noindex і дозвольте її сканування.
Не блокуйте папки CSS або JavaScript: Google потрібен до них доступ, щоб правильно побачити вашу сторінку.
Після завантаження перевірте активний файл, відкривши його у браузері.
Поширені запитання
Що робить robots.txt?
Він повідомляє сумлінним сканерам, до яких частин сайту можна надсилати запити. Це прохання, а не замок: файл не захищає приватний контент, а шкідливі боти його ігнорують.
Чи потрібен мені файл robots.txt?
Не обов'язково. Якщо його немає, сканери припускають, що можуть обходити все. Файл усе одно корисний, щоб указати sitemap і закрити від сканування сторінки кошика та адміністративної панелі.
Чи блокувати ботів ШІ?
Це бізнес-рішення. Блокування GPTBot, ClaudeBot, Google-Extended та подібних сканерів просить їх не використовувати ваш контент для навчання, але помічники ШІ можуть знати про бізнес менше. Багато малих компаній дозволяють сканування, щоб помічники ШІ могли їх рекомендувати.
Коли зміни набудуть чинності?
Зазвичай Google перечитує robots.txt протягом доби. Оновлення також можна запросити у звіті robots.txt в Google Search Console.
Як перевірити, чи заблоковано URL файлом robots.txt?
Скористайтесь інструментом перевірки на цій сторінці. Вставте свій robots.txt (або той, що щойно згенерували), введіть адресу та назву сканера — наприклад, Googlebot — і він покаже «Дозволено» або «Заблоковано» з конкретним правилом, що вирішило результат. Перевірка застосовує правила збігу Google у браузері й не завантажує ваш активний файл, тому вставте актуальну версію з yourdomain.com/robots.txt.
Якщо правила Allow і Disallow збігаються, яке з них має пріоритет?
Для Google перемагає правило з довшим шляхом, оскільки воно конкретніше. Якщо довжина шляхів однакова, перемагає Allow. Інші сканери можуть вирішувати конфлікти інакше, тому не покладайтесь на однакову довжину.
Як читаються правила robots.txt
Файл robots.txt складається зі списку груп. Кожна група починається з одного або кількох рядків User-agent, де вказано сканер (або * для всіх), а далі йдуть рядки Allow і Disallow зі шляхами URL. Сканер використовує найконкретнішу групу, яка його називає; у межах групи перемагає найдовший відповідний шлях.
«Disallow: /» блокує все. Порожній «Disallow:» дозволяє все. «Disallow: /admin/» блокує всі адреси, що починаються з /admin/. Шляхи чутливі до регістру.
Розумне стандартне налаштування для сайту малого бізнесу
Дозвольте сканування всього сайту, закрийте папки адміністративної панелі, кошика, оплати чи облікових записів, які використовує ваша платформа, і вкажіть sitemap. Більшості сайтів цього достатньо. Не використовуйте robots.txt, щоб приховати від Google сторінки подяки або дублікати: для цього призначений тег noindex.
На сайтах We.Inc файл robots.txt і sitemap створюються автоматично, тож генератор потрібен лише для сайтів на інших платформах.
Тестування URL перед завантаженням
Невелика помилка в robots.txt може заблокувати цілий розділ сайту, тому перевіряйте важливі адреси до завантаження: головну сторінку, сторінку товару чи послуги, допис у блозі та все, що ви збираєтесь блокувати. Введіть кожну адресу в інструмент перевірки з потрібним сканером — зазвичай Googlebot — і переконайтесь, що результат і відповідне правило відповідають вашим очікуванням.
Найбільше несподіванок — у шаблонах. «Disallow: /*?sort=» блокує будь-яку адресу з ?sort=, а «Disallow: /*.pdf$» блокує адреси, що закінчуються на .pdf, але не /file.pdf?download=1. Також пам'ятайте: сканер, названий у власній групі — наприклад, Googlebot-Image, — ігнорує групу * повністю, тому правила для всіх на нього не поширюються.