Kiểm tra sitemap: tìm trang website thiếu và xung đột
Công cụ kiểm tra sitemap
Kiểm tra sitemap: xác thực XML và tìm trang còn thiếu | We.Inc
Dán sitemap.xml để kiểm tra XML, tìm URL trùng, http, ngoài website hoặc ngày sai; so sánh với trang mong đợi và robots.txt, rồi tải kết quả CSV.
Mở sitemap (thường là yoursite.com/sitemap.xml), sao chép rồi dán vào đây hoặc tải tệp lên. Công cụ xác thực XML và từng URL, sau đó so sánh với danh sách trang mong đợi và robots.txt để bạn biết trang nào thiếu, trang nào không nên có và trang nào xung đột. Công cụ không truy cập website: trình duyệt chặn website đọc website khác nên chỉ kiểm tra nội dung bạn dán. Mọi thứ chạy trong trình duyệt. Nội dung nhập không gửi cho We.Inc hay bất kỳ ai và mất khi bạn đóng thẻ.
Dán nội dung sitemap.xml hoặc tải tệp lên (tối đa 10 MB). Công cụ cũng nhận biết tệp chỉ mục sitemap và liệt kê các sitemap con để bạn dán lần lượt.
XML được phân tích ngay trong trình duyệt. Bạn sẽ thấy tệp có hợp lệ không, có dùng không gian tên sitemap chuẩn không và chứa bao nhiêu URL so với giới hạn 50,000 URL và 50 MB.
Công cụ kiểm tra từng URL: địa chỉ https đầy đủ, cùng máy chủ với các URL còn lại, không có đoạn # hay tham số theo dõi, không trùng lặp và ngày lastmod hợp lệ, không ở tương lai.
Có thể dán danh sách trang mong đợi, chẳng hạn liên kết trong menu. Báo cáo chỉ ra trang dự kiến bị thiếu và trang sitemap không mong đợi.
Có thể dán robots.txt. Công cụ đánh dấu URL sitemap bị robots.txt chặn và cho biết robots.txt chưa trỏ đến sitemap hay không.
Tải kết quả dạng CSV. Để kiểm tra mã trạng thái, canonical và noindex của một URL, chạy lệnh curl hiển thị trên trang.
Chỉ liệt kê trang bạn muốn có trong kết quả tìm kiếm: địa chỉ https cuối cùng trả 200, không chuyển hướng và là canonical của chính nó.
Xóa trang có noindex. Sitemap liệt kê trang bạn yêu cầu công cụ tìm kiếm không lập chỉ mục sẽ tạo tín hiệu trái ngược.
Chỉ dùng lastmod khi biết ngày trang thực sự thay đổi. Đặt ngày hôm nay cho mọi trang khiến công cụ tìm kiếm bỏ qua trường này.
Thêm dòng Sitemap: kèm địa chỉ đầy đủ vào robots.txt để bot tìm sitemap mà không cần được báo riêng.
Gửi sitemap qua Google Search Console và Bing Webmaster Tools, rồi xem báo cáo các trang không thể truy cập.
Câu hỏi thường gặp
Công cụ có thu thập toàn bộ website không?
Không. Trang web không thể đọc tệp của website khác vì trình duyệt chặn việc đó và chúng tôi không chạy bot ẩn. Bạn dán sitemap, danh sách trang và robots.txt; các bước kiểm tra chạy trên phần văn bản đó. Báo cáo nêu chính xác số URL đã kiểm tra.
Làm sao kiểm tra mã trạng thái, canonical và noindex?
Chạy curl -sIL rồi đến địa chỉ trang trong terminal để xem mã trạng thái và chuyển hướng. Để xem canonical và thẻ meta robots, chạy curl -sL rồi đến địa chỉ và tìm rel="canonical" cùng name="robots" trong kết quả. Báo cáo lập chỉ mục trang trong Search Console hiển thị dữ liệu tương tự cho toàn website.
Sitemap có giới hạn gì?
Một tệp sitemap có thể chứa tối đa 50,000 URL và dung lượng tối đa 50 MB khi chưa nén. Website lớn chia URL qua nhiều sitemap được liệt kê trong tệp chỉ mục.
Vì sao URL http hoặc tên miền khác bị đánh dấu?
Sitemap nên liệt kê địa chỉ cuối trên cùng website nơi sitemap được lưu. Địa chỉ http trên website https sẽ chuyển hướng; URL trên máy chủ khác bị công cụ tìm kiếm bỏ qua trừ khi bạn xác minh gửi chéo website.
Sitemap hợp lệ có đảm bảo trang được lập chỉ mục không?
Không. Sitemap giúp công cụ tìm kiếm tìm trang, nhưng không đảm bảo chúng lập chỉ mục hay xếp hạng. Chất lượng, liên kết và tín hiệu kỹ thuật vẫn quyết định.
Nội dung tôi dán có được lưu không?
Không. Việc kiểm tra diễn ra trong trình duyệt và dữ liệu không được gửi đi đâu.
Trang bị thiếu và trang không nên liệt kê
Có hai loại lỗi cần lưu ý. Trang bị thiếu là trang thật bạn muốn người khác tìm thấy nhưng sitemap bỏ sót, thường là trang dịch vụ hoặc bài blog mới thêm sau khi tạo sitemap. Trang không nên có gồm địa chỉ cần loại bỏ: chuyển hướng, trang thử nghiệm, phiên bản lọc trùng lặp hoặc trang có noindex.
So sánh sitemap với danh sách đáng tin cậy như liên kết trong menu và chân trang là cách nhanh nhất để tìm cả hai. Công cụ giữ chúng thành danh sách riêng để bạn sửa lần lượt.
Phần kiểm tra này thấy và không thấy những gì
Mọi kết quả dựa trên văn bản bạn dán. Công cụ xác nhận XML hợp lệ và URL có định dạng nhất quán, đúng cấu trúc, được robots.txt cho phép. Công cụ không thể biết trang hiện trả 200 hay có thẻ noindex vì cần truy cập từng trang. Báo cáo ghi rõ mục chưa kiểm tra thay vì đoán.