Pemeriksa Peta Situs: Temukan Halaman yang Hilang dan Bertentangan
Pemeriksa Peta Situs
Pemeriksa Peta Situs: Validasi XML dan Temukan Halaman Hilang | We.Inc
Tempel sitemap.xml Anda untuk mengecek XML-nya, temukan URL duplikat, http, luar situs, dan bertanggal salah, bandingkan dengan halaman yang Anda harapkan dan dengan robots.txt, lalu unduh temuannya sebagai CSV.
Buka sitemap Anda (biasanya yoursite.com/sitemap.xml), salin, dan tempel di sini, atau unggah filenya. Checker ini memvalidasi XML dan setiap URL di dalamnya, lalu membandingkannya dengan daftar halaman yang Anda harapkan dan dengan robots.txt Anda, supaya Anda bisa melihat apa yang hilang, apa yang seharusnya tidak ada di sana, dan apa yang bertentangan. Alat ini tidak mengunjungi situs web Anda: browser memblokir satu situs membaca situs lain, jadi alat ini mengecek apa yang Anda tempel. Semuanya berjalan di browser Anda. Tidak ada yang Anda ketik dikirim ke We.Inc atau pihak lain mana pun, dan hilang begitu Anda menutup tab.
Tempel isi sitemap.xml Anda atau unggah filenya (hingga 10 MB). File indeks sitemap juga dikenali; checker ini mendaftar sitemap anaknya untuk Anda tempel satu per satu.
XML-nya diurai di browser Anda. Anda melihat apakah valid, apakah memakai namespace sitemap standar, dan berapa banyak URL yang dimilikinya terhadap batas 50,000 URL dan 50 MB.
Setiap URL dicek: alamat https lengkap, host yang sama dengan lainnya, tanpa fragmen #, tanpa parameter pelacakan, tanpa duplikat, dan tanggal lastmod yang valid yang tidak berada di masa depan.
Secara opsional tempel halaman yang Anda harapkan terdaftar, seperti tautan di menu Anda. Laporannya menunjukkan halaman yang diharapkan tapi hilang dari sitemap dan halaman sitemap yang tidak Anda harapkan.
Secara opsional tempel robots.txt Anda. Checker ini menandai URL sitemap yang diblokir robots.txt, dan memberi tahu Anda jika robots.txt tidak menunjuk ke sitemap.
Unduh temuannya sebagai CSV. Untuk kode status, canonical, dan noindex dari satu URL, jalankan perintah curl yang ditunjukkan di halaman.
Daftar hanya halaman yang Anda inginkan di hasil pencarian: alamat https akhir yang merespons 200, tidak diredirect, dan merupakan canonical-nya sendiri.
Hapus halaman yang noindex. Sitemap yang mendaftar halaman yang Anda minta mesin pencari untuk tidak mengindeks mengirim sinyal yang campur aduk.
Hanya pakai lastmod saat Anda tahu tanggal halamannya sungguh berubah. Mengatur setiap halaman ke hari ini mengajari mesin pencari mengabaikan kolomnya.
Tambahkan baris Sitemap: dengan alamat lengkap ke robots.txt supaya crawler bisa menemukan sitemapnya tanpa diberi tahu.
Kirim sitemapnya di Google Search Console dan Bing Webmaster Tools, lalu cek laporan mereka untuk halaman yang tidak bisa mereka ambil.
Pertanyaan yang sering diajukan
Apakah sitemap checker ini meng-crawl situs saya?
Tidak. Halaman web tidak bisa membaca file situs web lain karena browser memblokirnya, dan kami tidak menjalankan crawler tersembunyi. Anda menempel sitemap-nya, daftar halamannya, dan robots.txt, lalu pengecekannya berjalan pada teks itu. Laporannya menyatakan persis berapa banyak URL yang dicek.
Bagaimana cara mengecek kode status, canonical, dan noindex?
Jalankan curl -sIL diikuti alamat halamannya di terminal untuk melihat kode status dan redirect-nya. Untuk melihat canonical dan tag meta robots, jalankan curl -sL diikuti alamatnya dan cari rel="canonical" dan name="robots" di hasilnya. Laporan page indexing Search Console menunjukkan bukti yang sama untuk seluruh situs Anda.
Apa batas sitemap-nya?
Satu file sitemap bisa menyimpan hingga 50,000 URL dan hingga 50 MB tanpa kompresi. Situs besar memecah URL-nya di beberapa sitemap yang terdaftar di file indeks sitemap.
Mengapa URL http atau domain lain ditandai?
Sitemap seharusnya mendaftar alamat akhir di situs yang sama tempat sitemap itu berada. Alamat http di situs https meredirect, dan URL di host lain diabaikan mesin pencari kecuali Anda sudah memverifikasi pengiriman lintas situs.
Apakah sitemap yang valid berarti halaman saya akan diindeks?
Tidak. Sitemap membantu mesin pencari menemukan halaman; tidak membuat mereka mengindeks atau meranking halaman itu. Kualitas, tautan, dan sinyal teknis masih menentukan itu.
Apakah apa yang saya tempel disimpan?
Tidak. Pengecekannya berjalan di browser Anda dan tidak ada yang dikirim ke mana pun.
Halaman hilang dan halaman yang seharusnya tidak terdaftar
Dua jenis kesalahan yang penting. Halaman hilang adalah halaman nyata yang ingin Anda temukan yang dilewatkan sitemap-nya, sering halaman layanan baru atau artikel blog yang ditambahkan setelah sitemap-nya dibuat. Halaman tak diinginkan adalah alamat yang seharusnya tidak ada di sana sama sekali: redirect, halaman uji, versi terfilter dari halaman yang sama, atau halaman yang ditandai noindex.
Membandingkan sitemap-nya dengan daftar yang Anda percaya, seperti tautan di menu dan footer Anda, adalah cara tercepat menemukan keduanya. Checker ini menjaga keduanya di daftar terpisah supaya Anda bisa memperbaiki satu per satu.
Apa yang bisa dan tidak bisa dilihat pengecekan ini
Semuanya di sini berdasarkan teks yang Anda tempel. Ini bisa membuktikan XML-nya valid dan URL-nya terbentuk dengan baik, konsisten, dan diizinkan robots.txt Anda. Ini tidak bisa melihat apakah setiap halaman saat ini merespons 200 atau membawa tag noindex, karena itu butuh kunjungan ke setiap halaman. Laporannya melabeli itu sebagai belum dicek alih-alih menebak.