robots.txt जनरेटर: क्रॉलर और AI बॉट की सेटिंग | We.Inc
मुफ़्त robots.txt जनरेटर: क्रॉलर अनुमति या ब्लॉक करें, फ़ोल्डर रोकें, साइटमैप जोड़ें और चुनें कि GPTBot जैसे AI बॉट आपकी साइट पढ़ें या नहीं।
एक मिनट में सही robots.txt फ़ाइल बनाएं: सभी क्रॉलर के लिए डिफ़ॉल्ट चुनें, रोकने वाले फ़ोल्डर लिखें, साइटमैप जोड़ें और तय करें कि AI क्रॉलर आपकी सामग्री पढ़ सकते हैं या नहीं। नतीजा कॉपी करें या फ़ाइल डाउनलोड करें।
सभी क्रॉलर के लिए डिफ़ॉल्ट नियम चुनें: सबकी अनुमति दें (अधिकतर साइटों के लिए) या सबको रोकें (स्टेजिंग साइटों के लिए)।
जिन फ़ोल्डरों से क्रॉलर रोकने हैं, उन्हें हर पंक्ति में एक लिखें, जैसे /admin/ या /cart/।
साइटमैप का पता पेस्ट करें ताकि खोज इंजन हर पेज ढूंढ सकें।
चाहें तो AI प्रशिक्षण क्रॉलर रोकें। फिर robots.txt कॉपी या डाउनलोड करके डोमेन के रूट में अपलोड करें।
robots.txt ठीक yourdomain.com/robots.txt पर होनी चाहिए। दूसरी जगह रखी फ़ाइल अनदेखी होगी।
robots.txt में पेज रोकने से वह Google से नहीं हटता। नतीजों से बाहर रखने के लिए noindex टैग लगाएं और क्रॉल होने दें।
CSS या JavaScript फ़ोल्डर कभी ब्लॉक न करें; पेज ठीक से देखने के लिए Google को उनकी ज़रूरत होती है।
अपलोड के बाद ब्राउज़र में खोलकर लाइव फ़ाइल जांचें।
अक्सर पूछे जाने वाले सवाल
robots.txt क्या करती है?
यह अच्छे व्यवहार वाले क्रॉलर को बताती है कि साइट के किन हिस्सों का अनुरोध कर सकते हैं। यह अनुरोध है, ताला नहीं: निजी सामग्री सुरक्षित नहीं करती और खराब बॉट इसे अनदेखा करते हैं।
क्या robots.txt फ़ाइल चाहिए?
ज़रूरी नहीं। फ़ाइल न हो तो क्रॉलर मानते हैं कि सब कुछ क्रॉल कर सकते हैं। फिर भी साइटमैप का पता देने और कार्ट तथा एडमिन स्क्रीन जैसे पेजों से क्रॉलर रोकने के लिए यह उपयोगी है।
क्या AI क्रॉलर रोकने चाहिए?
यह कारोबारी फैसला है। GPTBot, ClaudeBot, Google-Extended और ऐसे क्रॉलर रोकने से उनसे आपकी सामग्री प्रशिक्षण में इस्तेमाल न करने का अनुरोध होता है, पर AI सहायक आपके कारोबार के बारे में कम जान सकते हैं। कई छोटे कारोबार अनुमति देते हैं ताकि AI जवाब उनकी सिफ़ारिश कर सकें।
बदलाव लागू होने में कितना समय लगता है?
Google आमतौर पर एक दिन के भीतर robots.txt फिर पढ़ता है। Google Search Console की robots.txt रिपोर्ट में रीफ़्रेश का अनुरोध कर सकते हैं।
कोई URL robots.txt से ब्लॉक है या नहीं, यह कैसे जांचें?
इस पेज पर मौजूद टेस्टर इस्तेमाल करें। अपनी robots.txt पेस्ट करें (या जो अभी बनाई उसे), पता और क्रॉलर का नाम जैसे Googlebot डालें, और यह Allowed या Blocked दिखाएगा, साथ में वह सटीक नियम जिसने फैसला किया। यह Google के मेल-खाने के नियम आपके ब्राउज़र में लागू करता है और आपकी लाइव फ़ाइल नहीं लाता, इसलिए yourdomain.com/robots.txt से मौजूदा संस्करण पेस्ट करें।
अगर Allow और Disallow दोनों नियम मेल खाएं तो कौन जीतता है?
Google के लिए, लंबे पथ वाला नियम जीतता है क्योंकि वह ज्यादा विशिष्ट है। अगर दोनों पथ एक ही लंबाई के हों, तो Allow जीतता है। दूसरे क्रॉलर टकराव अलग तरह से सुलझा सकते हैं, इसलिए बराबरी पर निर्भर न रहें।
robots.txt नियम कैसे पढ़े जाते हैं
robots.txt फ़ाइल समूहों की सूची है। हर समूह User-agent पंक्ति से शुरू होता है, जिसमें क्रॉलर का नाम (या सभी के लिए *) होता है; उसके बाद URL पथ वाली Allow और Disallow पंक्तियां आती हैं। क्रॉलर उसे नाम देने वाला सबसे विशिष्ट समूह इस्तेमाल करता है; समूह में सबसे लंबा मेल खाता पथ लागू होता है।
Disallow: / सब रोकता है। खाली Disallow: सबकी अनुमति देता है। Disallow: /admin/ से /admin/ से शुरू होने वाला हर पता रुकता है। पथ में बड़े और छोटे अक्षर अलग माने जाते हैं।
छोटे कारोबार की साइट के लिए सही डिफ़ॉल्ट
सबकी अनुमति दें, प्लेटफ़ॉर्म के एडमिन, कार्ट, चेकआउट या अकाउंट फ़ोल्डर रोकें और साइटमैप सूचीबद्ध करें। अधिकतर साइटों को इतना ही चाहिए। Google से धन्यवाद या डुप्लिकेट पेज छिपाने के लिए robots.txt न लें; noindex टैग यह काम सही करता है।
We.Inc पर प्रकाशित हर साइट robots.txt और साइटमैप अपने आप देती है, इसलिए यह जनरेटर आपको दूसरी जगह होस्ट की साइटों के लिए चाहिए।
अपलोड से पहले URL जांचना
robots.txt में एक छोटी गलती पूरे साइट के एक हिस्से को ब्लॉक कर सकती है, इसलिए अपलोड से पहले जरूरी पते जांचें: होमपेज, कोई प्रोडक्ट या सर्विस पेज, एक ब्लॉग पोस्ट, और जो भी आपने ब्लॉक करने का इरादा किया था। हर एक को टेस्टर में उस क्रॉलर के साथ डालें जो आपको चाहिए, आमतौर पर Googlebot, और जांचें कि नतीजा और तय करने वाला नियम वही है जो आप चाहते थे।
वाइल्डकार्ड सबसे ज्यादा चौंकाने वाले होते हैं। 'Disallow: /*?sort=' किसी भी ?sort= वाले पते को ब्लॉक करता है, और 'Disallow: /*.pdf$' वे पते ब्लॉक करता है जो .pdf पर खत्म होते हैं लेकिन /file.pdf?download=1 नहीं। यह भी याद रखें कि अपने खुद के समूह में नाम वाला क्रॉलर, जैसे Googlebot-Image, * समूह को पूरी तरह अनदेखा करता है, इसलिए सबके लिए लिखे नियम उस पर लागू नहीं होते।