Sprawdzanie mapy witryny: znajdź brakujące i sprzeczne strony
Sprawdzanie mapy witryny
Sprawdzanie mapy witryny: walidacja XML i brakujące strony | We.Inc
Wklej sitemap.xml, aby sprawdzić XML, znaleźć zduplikowane, http, zewnętrzne i źle datowane adresy, porównać go z oczekiwanymi stronami i robots.txt, a następnie pobierz wyniki jako CSV.
Otwórz swoją mapę witryny (zwykle yoursite.com/sitemap.xml), skopiuj ją i wklej tutaj albo wgraj plik. Narzędzie waliduje XML i każdy adres URL w nim, a następnie porównuje go z listą oczekiwanych stron i z Twoim robots.txt, abyś zobaczył, czego brakuje, co nie powinno tam być i co jest sprzeczne. Nie odwiedza Twojej strony: przeglądarki blokują jednej witrynie czytanie drugiej, więc sprawdza to, co wkleisz. Wszystko działa w Twojej przeglądarce. Nic, co wpiszesz, nie jest wysyłane do We.Inc ani nikogo innego i znika po zamknięciu karty.
Wklej zawartość swojego sitemap.xml lub wgraj plik (do 10 MB). Pliki indeksu map witryn też są rozpoznawane; narzędzie wypisuje podrzędne mapy witryn, które wklejasz po kolei.
XML jest analizowany w Twojej przeglądarce. Widzisz, czy jest poprawny, czy używa standardowej przestrzeni nazw mapy witryny i ile adresów URL zawiera w stosunku do limitów 50,000 adresów URL i 50 MB.
Każdy adres URL jest sprawdzany: pełny adres https, ten sam host co reszta, bez fragmentu #, bez parametrów śledzących, bez duplikatów i poprawna data lastmod, która nie jest z przyszłości.
Opcjonalnie wklej strony, które spodziewasz się zobaczyć na liście, takie jak linki w menu. Raport pokazuje oczekiwane strony brakujące w mapie witryny i strony w mapie, których się nie spodziewałeś.
Opcjonalnie wklej swój robots.txt. Narzędzie oznacza adresy z mapy witryny, które blokuje robots.txt, i mówi, jeśli robots.txt nie wskazuje mapy witryny.
Pobierz wyniki jako CSV. Aby sprawdzić kod statusu, canonical i noindex pojedynczego adresu, uruchom polecenie curl pokazane na stronie.
Wymieniaj tylko strony, które chcesz mieć w wynikach wyszukiwania: końcowe adresy https, które odpowiadają 200, nie są przekierowane i są własnym canonical.
Usuń strony z noindex. Mapa witryny wymieniająca strony, których prosisz wyszukiwarki nie indeksować, wysyła sprzeczne sygnały.
Używaj lastmod tylko wtedy, gdy znasz datę faktycznej zmiany strony. Ustawienie każdej strony na dziś uczy wyszukiwarki ignorować to pole.
Dodaj do robots.txt wiersz Sitemap: z pełnym adresem, aby roboty mogły znaleźć mapę witryny bez podpowiedzi.
Prześlij mapę witryny w Google Search Console i Bing Webmaster Tools, a potem sprawdź ich raporty pod kątem stron, których nie mogły pobrać.
Najczęściej zadawane pytania
Czy to narzędzie skanuje moją stronę?
Nie. Strona internetowa nie może czytać plików innej witryny, bo przeglądarki to blokują, a my nie uruchamiamy ukrytego robota. Wklejasz mapę witryny, listę stron i robots.txt, a kontrole działają na tym tekście. Raport mówi dokładnie, ile adresów URL sprawdzono.
Jak sprawdzić kody statusu, canonical i noindex?
Uruchom w terminalu curl -sIL, a po nim adres strony, aby zobaczyć jej kod statusu i przekierowania. Aby zobaczyć canonical i znacznik meta robots, uruchom curl -sL, a po nim adres, i poszukaj w wyniku rel="canonical" i name="robots". Raport indeksowania stron w Search Console pokazuje te same dowody dla całej Twojej witryny.
Jakie są limity mapy witryny?
Jeden plik mapy witryny może zawierać do 50,000 adresów URL i mieć do 50 MB po rozpakowaniu. Większe strony dzielą adresy na kilka map witryn wymienionych w pliku indeksu map witryn.
Dlaczego adresy http lub z innej domeny są oznaczane?
Mapa witryny powinna wymieniać końcowe adresy w tej samej witrynie, w której się znajduje. Adresy http na stronie z https przekierowują, a adresy URL na innym hoście są ignorowane przez wyszukiwarki, chyba że masz zweryfikowane przesyłanie między witrynami.
Czy poprawna mapa witryny oznacza, że moje strony zostaną zaindeksowane?
Nie. Mapa witryny pomaga wyszukiwarkom znaleźć strony; nie sprawia, że je zindeksują ani wyróżnią w rankingu. O tym nadal decydują jakość, linki i sygnały techniczne.
Czy to, co wklejam, jest przechowywane?
Nie. Sprawdzanie działa w Twojej przeglądarce i nic nie jest nigdzie wysyłane.
Brakujące strony i strony, których nie powinno być na liście
Liczą się dwa rodzaje błędów. Brakujące strony to prawdziwe strony, które chcesz, aby znaleziono, a które mapa witryny pomija, często nowe strony usług lub wpisy na blogu dodane po jej utworzeniu. Niechciane strony to adresy, których w ogóle nie powinno być: przekierowania, strony testowe, filtrowane wersje tej samej strony lub strony oznaczone noindex.
Porównanie mapy witryny z listą, której ufasz, taką jak linki w menu i stopce, to najszybszy sposób na znalezienie obu. To narzędzie trzyma je na osobnych listach, abyś mógł naprawiać po jednym.
Co to sprawdzanie widzi, a czego nie
Wszystko tutaj opiera się na tekście, który wklejasz. Może udowodnić, że XML jest poprawny, a adresy URL są prawidłowo zbudowane, spójne i dozwolone przez Twój robots.txt. Nie widzi, czy każda strona obecnie odpowiada 200 lub ma znacznik noindex, bo to wymaga odwiedzenia każdej strony. Raport oznacza je jako niesprawdzone, zamiast zgadywać.