Бесплатный генератор robots.txt: allow, disallow и ИИ-боты | We.Inc
Бесплатный генератор robots.txt: разрешите или заблокируйте всех краулеров, закройте папки, добавьте sitemap и выберите, могут ли ИИ-краулеры вроде GPTBot читать ваш сайт.
Составьте корректный файл robots.txt за минуту: выберите правило по умолчанию для всех краулеров, перечислите папки, которые нужно закрыть, добавьте свой sitemap и решите, могут ли ИИ-краулеры читать ваш контент. Скопируйте результат или скачайте его файлом.
Выберите правило по умолчанию для всех краулеров: разрешить всё (большинство сайтов) или заблокировать всё (тестовые сайты).
Добавьте папки, куда нельзя пускать краулеров, по одной на строку, например /admin/ или /cart/.
Вставьте адрес своего sitemap, чтобы поисковые системы могли найти каждую страницу.
По желанию заблокируйте ИИ-краулеры для обучения моделей. Затем скопируйте или скачайте robots.txt и загрузите его в корень вашего домена.
robots.txt должен находиться именно по адресу yourdomain.com/robots.txt. В любом другом месте он игнорируется.
Блокировка страницы в robots.txt не убирает её из Google. Чтобы исключить страницу из результатов, используйте тег noindex и позвольте её сканировать.
Никогда не блокируйте свои папки CSS или JavaScript; Google нужен доступ к ним, чтобы правильно увидеть вашу страницу.
Проверьте живой файл после загрузки, открыв его в браузере.
Частые вопросы
Что делает robots.txt?
Он сообщает добросовестным краулерам, какие части вашего сайта они могут запрашивать. Это просьба, а не замок: он не защищает приватный контент, а недобросовестные боты его игнорируют.
Нужен ли мне файл robots.txt?
Строго говоря, нет. Без него краулеры считают, что могут сканировать всё. Иметь его всё равно полезно, чтобы указать на sitemap и не пускать краулеров на страницы вроде корзины и админки.
Стоит ли блокировать ИИ-краулеров?
Это бизнес-решение. Блокировка GPTBot, ClaudeBot, Google-Extended и похожих краулеров просит их не использовать ваш контент для обучения, но может также означать, что ИИ-ассистенты будут меньше знать о вашем бизнесе. Многие малые предприятия оставляют их разрешёнными, чтобы ответы ИИ могли их рекомендовать.
Сколько времени нужно, чтобы изменения вступили в силу?
Google обычно перечитывает robots.txt в течение дня. Можно запросить обновление в отчёте robots.txt в Google Search Console.
Как проверить, заблокирован ли URL файлом robots.txt?
Воспользуйтесь тестером на этой странице. Вставьте ваш robots.txt (или используйте только что сгенерированный), введите адрес и имя краулера, например Googlebot, и он покажет «Разрешено» или «Заблокировано» с правилом, которое это определило. Инструмент применяет правила сопоставления Google в вашем браузере и не обращается к вашему файлу, поэтому вставьте актуальную версию с yourdomain.com/robots.txt.
Если совпадают и Allow, и Disallow, какое правило приоритетно?
Для Google побеждает правило с более длинным путём, поскольку оно более конкретное. Если пути одинаковой длины, побеждает Allow. Другие краулеры могут разрешать конфликты по-другому, поэтому лучше не полагаться на совпадения.
Как читаются правила robots.txt
Файл robots.txt — это список групп. Каждая группа начинается с одной или нескольких строк User-agent, называющих краулера (или * для всех), за которыми следуют строки Allow и Disallow с путями URL. Краулер использует наиболее конкретную группу, которая его называет, а внутри группы побеждает самый длинный совпадающий путь.
«Disallow: /» блокирует всё. Пустое «Disallow:» разрешает всё. «Disallow: /admin/» блокирует каждый адрес, начинающийся с /admin/. Пути чувствительны к регистру.
Разумные настройки по умолчанию для сайта малого бизнеса
Разрешите всё, заблокируйте любые папки админки, корзины, оформления заказа или аккаунта, которые использует ваша платформа, и укажите свой sitemap. Это всё, что нужно большинству сайтов. Не используйте robots.txt, чтобы скрыть от Google страницы благодарности или дубли — для этого правильно работает тег noindex.
Каждый сайт, опубликованный на We.Inc, уже автоматически отдаёт robots.txt и sitemap, так что этот генератор нужен вам только для сайтов, размещённых где-то ещё.
Проверка URL перед загрузкой
Маленькая ошибка в robots.txt может заблокировать целый раздел сайта, поэтому перед загрузкой проверяйте важные адреса: главную страницу, страницу товара или услуги, статью в блоге и всё, что вы хотели заблокировать. Введите каждый адрес в тестер с нужным краулером, обычно Googlebot, и убедитесь, что результат и определяющее правило соответствуют ожиданиям.
Подстановочные знаки чаще всего преподносят сюрпризы. «Disallow: /*?sort=» блокирует любой адрес, содержащий ?sort=, а «Disallow: /*.pdf$» блокирует адреса, заканчивающиеся на .pdf, но не /file.pdf?download=1. Также помните, что краулер, указанный в собственной группе, например Googlebot-Image, полностью игнорирует группу *, поэтому правила для всех на него не распространяются.