Проверка sitemap: поиск пропущенных и конфликтующих страниц
Проверка sitemap
Проверка sitemap: валидация XML и поиск пропущенных страниц | We.Inc
Вставьте свой sitemap.xml, чтобы проверить XML, найти дублирующиеся, http, внешние и неверно датированные URL, сравнить со списком ожидаемых страниц и с robots.txt, затем скачать результаты как CSV.
Откройте свой sitemap (обычно yoursite.com/sitemap.xml), скопируйте его и вставьте сюда, либо загрузите файл. Проверка валидирует XML и каждый URL в нём, затем сравнивает со списком страниц, которые вы ожидаете, и с вашим robots.txt, чтобы вы увидели, что пропущено, что не должно там быть и что конфликтует. Она не заходит на ваш сайт: браузеры не дают одному сайту читать другой, так что она проверяет то, что вы вставили. Всё считается в вашем браузере. Ничего из того, что вы вводите, не отправляется в We.Inc или кому-либо ещё, и всё исчезает при закрытии вкладки.
Вставьте содержимое своего sitemap.xml или загрузите файл (до 10 МБ). Индексные файлы sitemap тоже распознаются; проверка перечисляет дочерние sitemap, чтобы вы вставили их по одному.
XML разбирается в вашем браузере. Вы видите, валиден ли он, использует ли стандартное пространство имён sitemap, и сколько URL в нём относительно лимитов 50 000 URL и 50 МБ.
Каждый URL проверяется: полный https-адрес, тот же хост, что и у остальных, без # фрагмента, без параметров отслеживания, без дублей, и валидная дата lastmod не в будущем.
По желанию вставьте страницы, которые вы ожидаете увидеть в списке, например ссылки из вашего меню. Отчёт покажет ожидаемые страницы, пропущенные в sitemap, и страницы sitemap, которых вы не ожидали.
По желанию вставьте свой robots.txt. Проверка отмечает URL из sitemap, которые блокирует robots.txt, и сообщает, если robots.txt не указывает на sitemap.
Скачайте результаты как CSV. Для кода статуса, canonical и noindex отдельного URL выполните команду curl, показанную на странице.
Перечисляйте только страницы, которые хотите видеть в результатах поиска: финальные https-адреса, которые отвечают 200, не редиректятся и являются собственным canonical.
Убирайте страницы, которые noindex. Sitemap, перечисляющий страницы, которые вы просите поисковые системы не индексировать, посылает противоречивые сигналы.
Используйте lastmod только тогда, когда знаете дату, когда страница реально изменилась. Если ставить везде сегодняшнюю дату, поисковые системы научатся игнорировать это поле.
Добавьте строку Sitemap: с полным адресом в robots.txt, чтобы краулеры могли найти sitemap без подсказок.
Отправьте sitemap в Google Search Console и Bing Webmaster Tools, затем проверьте их отчёты на страницы, которые не удалось загрузить.
Частые вопросы
Эта проверка sitemap сканирует мой сайт?
Нет. Веб-страница не может читать файлы другого сайта, потому что браузеры это блокируют, а мы не запускаем скрытый краулер. Вы вставляете sitemap, список страниц и robots.txt, и проверки выполняются над этим текстом. Отчёт точно сообщает, сколько URL было проверено.
Как проверить коды статуса, canonical и noindex?
Выполните curl -sIL с адресом страницы в терминале, чтобы увидеть код статуса и редиректы. Чтобы увидеть canonical и meta-тег robots, выполните curl -sL с адресом и найдите rel="canonical" и name="robots" в выводе. Отчёт об индексации страниц в Search Console показывает те же данные для всего вашего сайта.
Какие лимиты у sitemap?
Один файл sitemap может содержать до 50 000 URL и быть до 50 МБ в несжатом виде. Крупные сайты разбивают свои URL на несколько sitemap, перечисленных в индексном файле sitemap.
Почему отмечаются http или URL с другого домена?
Sitemap должен перечислять финальные адреса на том же сайте, где находится sitemap. http-адреса на https-сайте редиректят, а URL на другом хосте поисковые системы игнорируют, если вы не подтвердили кросс-доменную отправку.
Валидный sitemap означает, что мои страницы будут проиндексированы?
Нет. Sitemap помогает поисковым системам находить страницы; он не заставляет их индексировать или ранжировать эти страницы. Это всё ещё решают качество, ссылки и технические сигналы.
То, что я вставляю, сохраняется?
Нет. Проверка работает в вашем браузере, и ничего никуда не отправляется.
Пропущенные страницы и страницы, которых не должно быть в списке
Важны два вида ошибок. Пропущенные страницы — это реальные страницы, которые вы хотите видеть найденными, но sitemap их не включает, часто новые страницы услуг или записи блога, добавленные после создания sitemap. Нежелательные страницы — это адреса, которых там вообще не должно быть: редиректы, тестовые страницы, отфильтрованные версии той же страницы или страницы с пометкой noindex.
Сравнение sitemap со списком, которому вы доверяете, например ссылками в меню и подвале, — самый быстрый способ найти оба типа ошибок. Эта проверка держит их в отдельных списках, чтобы вы могли исправлять по одному за раз.
Что эта проверка может и не может увидеть
Всё здесь основано на тексте, который вы вставили. Она может доказать, что XML валиден, а URL правильно сформированы, согласованы и разрешены вашим robots.txt. Она не может увидеть, отвечает ли каждая страница сейчас 200 или несёт ли тег noindex, потому что для этого нужен визит на каждую страницу. Отчёт помечает такое как «не проверено», а не угадывает.