サイトマップチェッカー:Webサイトの未掲載・競合ページを確認
サイトマップチェッカー
サイトマップチェッカー:XML検証と未掲載ページの確認 | We.Inc
sitemap.xmlを貼り付け、XML、重複、http、外部ドメイン、古い日付のURLを確認。期待するページやrobots.txtと比較し、結果をCSVでダウンロードできます。
通常はyoursite.com/sitemap.xmlにあるサイトマップを開いてコピーし、ここに貼り付けるかファイルをアップロードします。XMLとURLを検証し、想定するページ一覧やrobots.txtと比較して、不足、不要、競合を確認できます。Webサイトにはアクセスしません。ブラウザーは別サイトの情報を読み取れないため、入力内容を検査します。すべてブラウザー内で動作し、入力内容はWe.Incや他の誰にも送信されず、タブを閉じると消去されます。
- sitemap.xmlの内容を貼り付けるか、最大10 MBのファイルをアップロードします。サイトマップインデックスも認識し、含まれる子サイトマップを表示するため、1つずつ貼り付けて確認できます。
- XMLをブラウザー内で解析します。構文が有効か、標準サイトマップ名前空間を使っているか、50,000 URLと50 MBの上限に対して何件含むかを表示します。
- すべてのURLを確認します。httpsの完全なURL、他のURLと同じホスト、#フラグメントや追跡パラメーターがないこと、重複がないこと、未来日ではない有効な最終更新日であることを検証します。
- 任意でメニューのリンクなど、掲載されているはずのページを貼り付けます。サイトマップにない想定ページと、想定外に含まれるページをレポートに表示します。
- 任意でrobots.txtを貼り付けます。robots.txtでブロックされているサイトマップURLや、サイトマップを指定していない場合に警告します。
- 結果をCSVでダウンロードします。単一URLのステータスコード、canonical、noindexを確認するには、ページに表示されるcurlコマンドを実行します。
- 検索結果に載せたい最終的なhttps URLだけを掲載します。200を返し、転送されず、自身をcanonicalとするページが対象です。
- noindexページは除外します。インデックスしないよう求めながらサイトマップに記載すると、検索エンジンに矛盾した情報を送ります。
- ページが実際に更新された日付を把握している場合のみlastmodを使います。すべてのページを今日の日付にすると、検索エンジンは項目を無視するようになります。
- クローラーがサイトマップを見つけられるよう、robots.txtに完全なURLのSitemap:行を追加します。
- Google Search ConsoleとBing Webmaster Toolsにサイトマップを送信し、取得できなかったページのレポートを確認します。
よくある質問
このチェッカーはサイトをクロールしますか?
いいえ。ブラウザーは別サイトのファイルを読み取れず、隠れたクローラーも動かしません。サイトマップ、ページ一覧、robots.txtを貼り付けると、そのテキストを検査します。チェックしたURL数もレポートに表示します。
ステータスコード、canonical、noindexを確認するには?
ターミナルでcurl -sILに続けてページのアドレスを実行すると、ステータスコードと転送を確認できます。canonicalとrobotsメタタグは、curl -sLとアドレスを実行し、出力内のrel="canonical"とname="robots"を探します。サイト全体についてはSearch Consoleのページインデックスレポートでも同様の情報を確認できます。
サイトマップの上限は?
1つのサイトマップには最大50,000 URLを含められ、非圧縮で最大50 MBです。大規模サイトでは複数のサイトマップにURLを分け、サイトマップインデックスにまとめます。
httpや別ドメインのURLに警告が出るのはなぜですか?
サイトマップには、同じサイト上の最終URLを記載します。httpsサイトのhttp URLは転送されます。別ホストのURLは、サイト間送信を確認済みの場合を除き、検索エンジンに無視されます。
有効なサイトマップならページがインデックス登録されますか?
いいえ。サイトマップは検索エンジンによるページ発見を助けますが、インデックス登録や順位を保証しません。品質、リンク、技術的なシグナルも影響します。
貼り付けた内容は保存されますか?
いいえ。ブラウザー内で確認し、内容はどこにも送信されません。
不足ページと掲載すべきでないページ
- 重要な間違いは2種類あります。不足ページは、見つけてもらいたいのにサイトマップにない実在ページです。サイトマップ作成後に追加したサービスページやブログ記事などが該当します。不要なページは、転送URL、テストページ、同じページの絞り込み版、noindexページなど、掲載すべきでないURLです。
- メニューやフッターのリンクなど信頼できる一覧とサイトマップを比較すれば、両方を早く見つけられます。このチェッカーは別々の一覧に表示するため、順に修正できます。
このチェックで分かること、分からないこと
- 確認は貼り付けたテキストをもとに行います。XMLが有効か、URL形式や一貫性に問題がないか、robots.txtで許可されているかは確認できます。各ページを実際に取得しないと分からない200応答やnoindexタグは確認できません。推測せず、レポートでは未確認として示します。
無料で始める · クレジットカード不要
製品
ご利用いただける方
機能
リソース
会社情報
サイトマップを見る