Перевірка sitemap: пошук відсутніх і суперечливих сторінок
Перевірка sitemap
Перевірка sitemap: валідація XML і пошук відсутніх сторінок | We.Inc
Вставте sitemap.xml, щоб перевірити XML, дублікати, адреси http і зовнішні URL, некоректні дати, очікувані сторінки та узгодженість із robots.txt, а потім завантажте результати у CSV.
Відкрийте sitemap (зазвичай yoursite.com/sitemap.xml), скопіюйте й вставте його сюди або завантажте файл. Інструмент перевіряє XML і кожну URL-адресу, а потім порівнює їх зі списком очікуваних сторінок і файлом robots.txt, щоб показати, чого бракує, чого там не має бути та що суперечить іншим даним. Він не відкриває ваш сайт: браузери забороняють одному сайту читати інший, тож перевіряється лише вставлений вміст. Усе працює у вашому браузері. Введені вами дані не надсилаються до We.Inc чи будь-кому іншому та зникають після закриття вкладки.
Вставте вміст sitemap.xml або завантажте файл (до 10 MB). Інструмент розпізнає також індексні файли sitemap і покаже дочірні карти, які можна перевірити по одній.
XML обробляється у вашому браузері. Ви побачите, чи правильний формат, чи використовується стандартний простір імен sitemap і скільки URL міститься у файлі порівняно з обмеженнями 50,000 URL і 50 MB.
Перевіряються всі URL: повна адреса https, той самий хост, відсутність фрагмента # і параметрів відстеження та дублікатів, а також правильна дата lastmod, яка не є майбутньою.
За бажанням вставте список очікуваних сторінок, наприклад посилань у меню. У звіті показано сторінки, яких бракує в sitemap, і сторінки з sitemap, яких ви не очікували побачити.
За бажанням вставте robots.txt. Інструмент позначить URL sitemap, заблоковані у robots.txt, і повідомить, якщо в robots.txt немає посилання на sitemap.
Завантажте результати у CSV. Щоб перевірити код статусу, canonical і noindex одного URL, виконайте команду curl, наведену на сторінці.
Додавайте лише сторінки, які мають з’явитися в результатах пошуку: кінцеві адреси https зі статусом 200, без перенаправлення й із canonical на саму себе.
Вилучіть сторінки з noindex. Sitemap із адресами, які ви просите пошукові системи не індексувати, надсилає суперечливі сигнали.
Використовуйте lastmod лише тоді, коли знаєте справжню дату зміни сторінки. Якщо вказувати сьогоднішню дату для всіх сторінок, пошукові системи перестануть зважати на це поле.
Додайте до robots.txt рядок Sitemap: із повною адресою, щоб сканери могли знайти sitemap без підказки.
Надішліть sitemap у Google Search Console і Bing Webmaster Tools, а потім перевірте їхні звіти про сторінки, які не вдалося отримати.
Поширені запитання
Чи сканує ця перевірка весь сайт?
Ні. Вебсторінка не може читати файли іншого сайту через обмеження браузера, а ми не запускаємо прихований сканер. Ви вставляєте sitemap, список сторінок і robots.txt, а перевірки виконуються для цього тексту. У звіті точно вказано, скільки URL перевірено.
Як перевірити коди статусу, canonical і noindex?
Виконайте в терміналі команду curl -sIL з адресою сторінки, щоб побачити код статусу й перенаправлення. Щоб побачити canonical і метатег robots, виконайте curl -sL з адресою та знайдіть у результаті rel="canonical" і name="robots". Звіт про індексацію сторінок у Search Console показує такі самі дані для всього сайту.
Які обмеження sitemap?
Один файл sitemap може містити до 50,000 URL і мати розмір до 50 MB без стиснення. На більших сайтах URL розподіляють між кількома sitemap, переліченими в індексному файлі.
Чому позначаються адреси http або URL іншого домену?
У sitemap мають бути кінцеві адреси того самого сайту, на якому розміщено файл. Адреси http на сайті з https перенаправляються, а URL іншого хоста пошукові системи ігнорують, якщо не підтверджено перехресне надсилання сайтів.
Чи означає правильна sitemap, що сторінки проіндексують?
Ні. Sitemap допомагає пошуковим системам знаходити сторінки, але не забезпечує їх індексацію чи високий рейтинг. На це й далі впливають якість, посилання й технічні сигнали.
Чи зберігаються вставлені дані?
Ні. Перевірка виконується у вашому браузері, дані нікуди не надсилаються.
Відсутні сторінки й сторінки, яких не має бути в sitemap
Важливі два типи помилок. Відсутні сторінки — це справжні сторінки, які потрібно знаходити, але їх немає в sitemap; часто це нові сторінки послуг або дописи блогу, додані після створення карти. Небажані сторінки — це адреси, яких там зовсім не має бути: перенаправлення, тестові сторінки, відфільтровані версії тієї самої сторінки або сторінки з noindex.
Найшвидший спосіб знайти обидва типи — порівняти sitemap зі списком, якому довіряєте, наприклад посиланнями в меню й нижньому колонтитулі. Інструмент показує їх в окремих списках, тож можна виправляти по черзі.
Що ця перевірка може й не може визначити
Уся перевірка ґрунтується на вставленому вами тексті. Вона може підтвердити, що XML правильний, а URL сформовані послідовно й дозволені robots.txt. Але вона не може дізнатися, чи сторінка зараз повертає код 200 і чи має тег noindex, бо для цього потрібно відкрити кожну сторінку. У звіті такі пункти позначаються як неперевірені, а не вгадуються.