साइटमैप जांच: वेबसाइट के छूटे और परस्पर-विरोधी पेज ढूंढें
साइटमैप जांच टूल
साइटमैप जांच: XML मान्य करें और छूटे पेज ढूंढें | We.Inc
sitemap.xml पेस्ट करके XML जांचें, डुप्लिकेट, http, बाहरी और गलत तारीख वाले URL ढूंढें, अपेक्षित पेजों और robots.txt से तुलना करें और नतीजे CSV में डाउनलोड करें।
अपना साइटमैप खोलें (आमतौर पर yoursite.com/sitemap.xml), उसे कॉपी करके यहां पेस्ट करें या फ़ाइल अपलोड करें। जांच टूल XML और हर URL मान्य करता है, फिर अपेक्षित पेजों की सूची और robots.txt से तुलना करता है। इससे छूटी, अनावश्यक और विरोधी जानकारी दिखती है। यह आपकी वेबसाइट पर नहीं जाता: ब्राउज़र एक साइट को दूसरी पढ़ने से रोकते हैं, इसलिए यह आपके पेस्ट किए डेटा की जांच करता है। सब ब्राउज़र में चलता है। आपकी लिखी जानकारी We.Inc या किसी और को नहीं भेजी जाती और टैब बंद करने पर मिट जाती है।
sitemap.xml की सामग्री पेस्ट करें या फ़ाइल अपलोड करें (10 MB तक)। साइटमैप इंडेक्स फ़ाइलें भी पहचानी जाती हैं; टूल उनके अंदर के साइटमैप सूचीबद्ध करता है जिन्हें आप एक-एक करके पेस्ट कर सकते हैं।
XML आपके ब्राउज़र में पढ़ा जाता है। देखें कि वह मान्य है या नहीं, मानक साइटमैप नेमस्पेस इस्तेमाल करता है या नहीं, और उसमें 50,000 URL तथा 50 MB की सीमाओं के मुकाबले कितने URL हैं।
हर URL जांचा जाता है: पूरा https पता, बाकी के समान होस्ट, # हिस्सा या ट्रैकिंग पैरामीटर नहीं, डुप्लिकेट नहीं और सही lastmod तारीख जो भविष्य की न हो।
चाहें तो अपेक्षित पेज पेस्ट करें, जैसे मेन्यू के लिंक। रिपोर्ट साइटमैप से छूटे अपेक्षित पेज और साइटमैप के अनपेक्षित पेज दिखाती है।
चाहें तो robots.txt पेस्ट करें। टूल robots.txt से रोके गए साइटमैप URL चिह्नित करता है और बताता है कि robots.txt में साइटमैप का पता नहीं है।
नतीजे CSV में डाउनलोड करें। किसी एक URL का स्थिति कोड, canonical और noindex देखने के लिए पेज पर दिया curl कमांड चलाएं।
सिर्फ़ वे पेज सूचीबद्ध करें जिन्हें खोज नतीजों में चाहते हैं: अंतिम https पते जो 200 जवाब दें, रीडायरेक्ट न हों और अपना canonical हों।
noindex वाले पेज हटाएं। जिन पेजों को इंडेक्स न करने को कहते हैं उन्हें साइटमैप में रखने से मिले-जुले संकेत जाते हैं।
lastmod सिर्फ़ तभी दें जब पेज बदलने की सही तारीख पता हो। हर पेज पर आज की तारीख रखने से खोज इंजन इस फ़ील्ड को अनदेखा करना सीखते हैं।
robots.txt में पूरे पते वाली Sitemap: पंक्ति जोड़ें, ताकि क्रॉलर को साइटमैप मिल जाए।
Google Search Console और Bing Webmaster Tools में साइटमैप भेजें, फिर उन पेजों की रिपोर्ट देखें जिन्हें वे नहीं ला सके।
अक्सर पूछे जाने वाले सवाल
क्या यह साइटमैप जांच टूल मेरी साइट क्रॉल करता है?
नहीं। ब्राउज़र दूसरी वेबसाइट की फ़ाइलें पढ़ने से रोकते हैं और हम छिपा क्रॉलर नहीं चलाते। आप साइटमैप, पेज सूची और robots.txt पेस्ट करें; जांच उन्हीं टेक्स्ट पर होती है। रिपोर्ट जांचे गए URL की सही संख्या बताती है।
स्थिति कोड, canonical और noindex कैसे जांचूं?
स्थिति कोड और रीडायरेक्ट देखने के लिए टर्मिनल में पेज पते के बाद curl -sIL चलाएं। Canonical और robots meta tag देखने के लिए curl -sL चलाकर नतीजे में rel="canonical" और name="robots" खोजें। Search Console की पेज इंडेक्सिंग रिपोर्ट पूरी साइट के लिए यही जानकारी देती है।
साइटमैप की सीमाएं क्या हैं?
एक साइटमैप फ़ाइल में अधिकतम 50,000 URL और बिना कंप्रेस किए 50 MB तक हो सकते हैं। बड़ी साइटें URL को कई साइटमैप में बांटकर साइटमैप इंडेक्स फ़ाइल में सूचीबद्ध करती हैं।
http या दूसरे डोमेन के URL चिह्नित क्यों होते हैं?
साइटमैप में उसी साइट के अंतिम पते होने चाहिए जहां साइटमैप रखा है। https साइट पर http पते रीडायरेक्ट होते हैं और दूसरे होस्ट के URL खोज इंजन अनदेखा करते हैं, जब तक क्रॉस-साइट सबमिशन सत्यापित न हो।
क्या मान्य साइटमैप से मेरे पेज इंडेक्स होंगे?
नहीं। साइटमैप खोज इंजन को पेज ढूंढने में मदद करता है; पेज इंडेक्स या रैंक होने की गारंटी नहीं। गुणवत्ता, लिंक और तकनीकी संकेत अब भी यह तय करते हैं।
क्या पेस्ट की जानकारी सेव होती है?
नहीं। जांच आपके ब्राउज़र में चलती है और कुछ भी कहीं नहीं भेजा जाता।
छूटे और सूची में न होने वाले पेज
दो तरह की गलतियां मायने रखती हैं। छूटे पेज वे असली पेज हैं जिन्हें ढूंढना चाहते हैं, पर साइटमैप में नहीं हैं; अक्सर साइटमैप बनने के बाद जोड़े गए नए सेवा पेज या ब्लॉग पोस्ट। अनचाहे पेज वे पते हैं जो वहां होने ही नहीं चाहिए: रीडायरेक्ट, टेस्ट पेज, एक पेज के फ़िल्टर वाले रूप या noindex पेज।
साइटमैप की तुलना भरोसेमंद सूची, जैसे मेन्यू और फ़ुटर के लिंक, से करना दोनों खोजने का सबसे तेज़ तरीका है। यह टूल उन्हें अलग सूचियों में रखता है ताकि एक-एक करके ठीक करें।
यह जांच क्या देख सकती है और क्या नहीं
यहां सब कुछ आपके पेस्ट किए टेक्स्ट पर आधारित है। यह जांच सकती है कि XML मान्य है और URL सही, एकसमान तथा robots.txt से अनुमत हैं। हर पेज अभी 200 जवाब देता है या noindex टैग रखता है, यह नहीं देख सकती क्योंकि उसके लिए हर पेज खोलना होगा। रिपोर्ट अनुमान के बजाय उन्हें “जांच नहीं हुई” चिह्नित करती है।