Robots.txt जेनरेटर

robots.txt नियम जनरेटर

मल्टी-लाइन Allow / Disallow / Sitemap का समर्थन करता है, स्वचालित रूप से मानक प्रारूप को इकट्ठा करता है।

नियम कॉन्फ़िगरेशन
जेनरेट किया गया परिणाम

GeekFormat ऑनलाइन Robots.txt जेनरेटर, विज़ुअल फॉर्म के माध्यम से User-agent, Allow/Disallow नियम, Sitemap घोषणा और Host निर्देश कॉन्फ़िगर करें, रीयल-टाइम Robots Exclusion Protocol मानक के अनुरूप robots.txt फ़ाइल बनाएं। पेज खुलते ही डिफ़ॉल्ट उदाहरण मान मौजूद होते हैं, किसी भी फ़ील्ड को संशोधित करें और निर्मित परिणाम का तुरंत पूर्वावलोकन करें, एक क्लिक से कॉपी करके वेबसाइट के रूट निर्देशिका में परिनियोजित कर सकते हैं। पूरी तरह से ब्राउज़र में स्थानीय रूप से चलता है, कॉन्फ़िगरेशन डेटा किसी भी सर्वर पर अपलोड नहीं किया जाता।

संबंधित सुझाव

Robots.txt और क्रॉलर अपवर्जन प्रोटोकॉल के बारे में

robots.txt वेबसाइट और खोज इंजन क्रॉलर के बीच संवाद करने के सबसे बुनियादी तरीकों में से एक है, पूरा नाम Robots Exclusion Protocol (क्रॉलर अपवर्जन प्रोटोकॉल, संक्षेप में REP) है। यह वेबसाइट के रूट निर्देशिका में रखी एक सादा टेक्स्ट फ़ाइल है, सरल निर्देशों के माध्यम से अनुपालन करने वाले खोज इंजन क्रॉलर को बताती है: वेबसाइट के कौन से हिस्से क्रॉल करने की अनुमति है, कौन से हिस्से क्रॉल नहीं करने चाहिए। robots.txt को सबसे पहले 1994 में Martijn Koster द्वारा प्रस्तावित किया गया था, लगभग 30 वर्षों के विकास के बाद, 2022 में IETF द्वारा आधिकारिक तौर पर RFC 9309 के रूप में मानकीकृत किया गया।

robots.txt की मूल संरचना में एक या अधिक नियम समूह (Group) होते हैं। प्रत्येक नियम समूह एक या अधिक User-agent पंक्तियों से शुरू होता है, जो उन क्रॉलर को निर्दिष्ट करता है जिन पर नियम लागू होते हैं (* सभी क्रॉलर का प्रतिनिधित्व करता है); इसके बाद कई Allow और Disallow पंक्तियाँ होती हैं, जो क्रमशः क्रॉल करने की अनुमति और निषेध वाले पथ उपसर्ग निर्दिष्ट करती हैं; फ़ाइल के अंत में Sitemap और Host जैसे गैर-समूह स्तरीय निर्देश जोड़े जा सकते हैं। प्रत्येक नियम समूह के बीच खाली पंक्ति से अलग करें। एक विशिष्ट robots.txt में शामिल हैं: User-agent घोषणा → Allow/Disallow पथ नियम → (वैकल्पिक) अधिक User-agent समूह → Sitemap घोषणा → Host निर्देश।

User-agent फ़ील्ड उस क्रॉलर का नाम निर्दिष्ट करता है जिस पर नियम लागू होता है। सामान्य खोज इंजन क्रॉलर नामों में शामिल हैं: Googlebot (Google खोज), Bingbot (Bing खोज), Baiduspider (Baidu खोज), YandexBot (Yandex खोज), DuckDuckBot (DuckDuckGo खोज), Twitterbot (Twitter/X कार्ड क्रॉल), facebookexternalhit (Facebook लिंक पूर्वावलोकन), GPTBot (OpenAI GPT क्रॉलर), Bytespider (ByteDance/Toutiao खोज) आदि। अलग-अलग मेल नहीं खाने वाले सभी क्रॉलर से मेल खाने के लिए वाइल्डकार्ड के रूप में User-agent: * का उपयोग करें।

Allow और Disallow निर्देश उपसर्ग मिलान (Prefix Matching) सिद्धांत का उपयोग करते हैं: जब तक URL पथ निर्दिष्ट मान से शुरू होता है, नियम मेल खाता है। उदाहरण के लिए Disallow: /admin /admin, /admin/, /admin/login.html, /administrator और /admin से शुरू होने वाले सभी पथों को ब्लॉक करेगा। यदि केवल /admin/ निर्देशिका से सटीक मेल खाना चाहते हैं, तो Disallow: /admin/ लिखना चाहिए (अंत में स्लैश जोड़ें)। RFC 9309 मानक के अनुसार, जब Allow और Disallow एक साथ मेल खाते हैं, तो सबसे लंबे पथ वाला नियम जीतता है; लंबाई समान होने पर Allow प्राथमिकता लेता है। इसका मतलब है कि जितना विशिष्ट नियम होगा उसकी प्राथमिकता उतनी ही अधिक होगी।

Sitemap निर्देश का उपयोग खोज इंजन को साइटमैप का स्थान बताने के लिए किया जाता है, जिससे क्रॉलर को वेबसाइट के पेजों को अधिक कुशलता से खोजने और इंडेक्स करने में मदद मिलती है। Sitemap पंक्ति को सभी नियम समूहों के बाद (या फ़ाइल के अंत में) रखा जाना चाहिए, URL पूर्ण पूर्ण पता होना चाहिए (http:// या https:// सहित)। एक robots.txt में कई Sitemap घोषित किए जा सकते हैं, प्रत्येक स्वतंत्र पंक्ति में। बड़ी साइटें आमतौर पर कई Sitemap में विभाजित होती हैं (सामग्री प्रकार, अपडेट आवृत्ति के अनुसार वर्गीकृत), और एक Sitemap इंडेक्स फ़ाइल के माध्यम से एकीकृत रूप से प्रबंधित की जाती हैं।

Host निर्देश Yandex द्वारा प्रस्तावित एक गैर-मानक लेकिन व्यापक रूप से उपयोग किया जाने वाला निर्देश है, जिसका उपयोग साइट के पसंदीदा डोमेन (मुख्य मिरर) को निर्दिष्ट करने के लिए किया जाता है। उदाहरण के लिए जब example.com और www.example.com एक साथ मौजूद हों, तो Host: example.com खोज इंजन को example.com को पसंदीदा के रूप में लेने के लिए कहता है। ध्यान दें: Google ने घोषणा की है कि वह Host निर्देश का उपयोग नहीं करता है, Google Search Console के माध्यम से पसंदीदा डोमेन सेट करने की आवश्यकता है; Bing भी स्पष्ट रूप से समर्थन नहीं करता है। Host निर्देश को Sitemap के बाद रखा जाना चाहिए, और केवल एक बार ही प्रकट हो सकता है।

robots.txt को सही ढंग से कॉन्फ़िगर करना SEO के लिए महत्वपूर्ण है: पहला यह है कि क्रॉलर को बेकार पेजों (जैसे खोज परिणाम पेज, फ़िल्टर पेज, डुप्लिकेट सामग्री पेज) पर क्रॉल बजट बर्बाद करने से रोकें, क्रॉलर को मूल्यवान सामग्री को अधिक कुशलता से क्रॉल करने दें; दूसरा यह है कि निजी या कम मूल्य वाले पेज (जैसे बैकएंड क्षेत्र, परीक्षण पेज, प्रिंट पेज) को इंडेक्स होने से रोकें; तीसरा यह है कि Sitemap के माध्यम से क्रॉलर को नए पेज खोजने के लिए सक्रिय रूप से मार्गदर्शन करें। लेकिन ध्यान दें: robots.txt एक सज्जन समझौता है, वास्तविक सुरक्षा उपायों को प्रतिस्थापित नहीं कर सकता; Disallow किए गए URL यदि बाहरी लिंक उन पर इंगित करते हैं, तो भी खोज परिणामों में URL दिखाई दे सकता है (केवल सामग्री क्रॉल नहीं करेगा); पूरी तरह से क्रॉल करने से रोकना इसके विपरीत साइट के समग्र वेट मूल्यांकन को प्रभावित कर सकता है।

robots.txt की सामान्य त्रुटियों में शामिल हैं: ①गलत पथ लिखना (जैसे Disallow: admin में आरंभिक स्लैश नहीं है, /admin लिखना चाहिए); ②रेगुलर एक्सप्रेशन का उपयोग करना (मानक REP रेगेक्स का समर्थन नहीं करता, केवल Googlebot सीमित वाइल्डकार्ड * और $ का समर्थन करता है); ③JS/CSS फ़ाइलों को क्रॉल करने से रोकना (इससे Google पेज रेंडर नहीं कर पाएगा); ④Disallow: / (पूरी साइट को प्रतिबंधित करना, यह घातक त्रुटि है, इससे वेबसाइट पूरी तरह से इंडेक्स नहीं होगी); ⑤फ़ाइल एन्कोडिंग समस्या (UTF-8 एन्कोडिंग होनी चाहिए); ⑥रूट निर्देशिका के बजाय उपनिर्देशिका में रखना; ⑦फ़ाइल अनुमति के कारण एक्सेस नहीं किया जा सकता (200 OK स्थिति कोड वापस करना चाहिए)। बनाने के बाद Google Search Console के robots.txt परीक्षण टूल या इस प्लेटफॉर्म के robots.txt निरीक्षण टूल से सत्यापन करने की सलाह दी जाती है।

उपयोग के मामले

  • नई साइट लॉन्च करने से पहले बुनियादी robots.txt कॉन्फ़िगर करें, क्रॉल करने की अनुमति और निषेध वाले पथ सीमा को स्पष्ट करें, खोज इंजनों को सही ढंग से क्रॉल करने के लिए मार्गदर्शन करें
  • साइट रीडिज़ाइन के बाद पुराने निर्देशिकाओं को क्रॉल होने से रोकने के लिए Disallow नियम अपडेट करें जो SEO वेट वितरण को प्रभावित करता है
  • खोज इंजनों को पूरी साइट के पेज संरचना को तेजी से खोजने में मदद करने के लिए कई Sitemap पते जोड़ें, इंडेक्सिंग दक्षता बढ़ाएं
  • बैकएंड प्रबंधन निर्देशिका (/admin), परीक्षण वातावरण, निजी निर्देशिका को क्रॉलर द्वारा इंडेक्स होने से रोकें, सुरक्षा जोखिम कम करें
  • साइट का पसंदीदा डोमेन (www के साथ या बिना www) निर्दिष्ट करने के लिए Host निर्देश सेट करें, डुप्लिकेट सामग्री समस्या को कम करें
  • विभिन्न खोज इंजन क्रॉलर (Googlebot, Bingbot, Baiduspider आदि) के लिए स्वतंत्र क्रॉल नियम कॉन्फ़िगर करें
  • रखरखाव के दौरान निर्देशिकाओं तक क्रॉलर पहुंच को अस्थायी रूप से प्रतिबंधित करें, साइट अपडेट पूरा होने के बाद क्रॉल फिर से खोलें
  • मानक प्रारूप की robots.txt फ़ाइल बनाएं, हस्तलिखित प्रारूप त्रुटियों से बचें जिससे खोज इंजन पार्स करने में विफल हों
  • पूरी साइट की सभी सामग्री प्रकारों को कवर करने के लिए बहु Sitemap (जैसे लेख sitemap, उत्पाद sitemap, छवि sitemap) कॉन्फ़िगर करें
  • फ्रंटएंड डेवलपर robots.txt नियम कॉन्फ़िगरेशन का प्रदर्शन करें, क्रॉलर प्रोटोकॉल मानक प्रारूप सिखाएं
  • यह सत्यापित करने के लिए robots.txt निरीक्षण टूल के साथ काम करें कि बनाए गए नियम अपेक्षा के अनुरूप हैं या नहीं, महत्वपूर्ण पेजों को गलती से ब्लॉक करने से बचें
  • तेजी से robots.txt टेम्पलेट बनाएं, डाउनलोड करने के बाद वास्तविक साइट स्थिति के अनुसार थोड़ा समायोजित करें और फिर परिनियोजित करें

उपयोग कैसे करें

  1. User-agent इनपुट बॉक्स में लक्ष्य क्रॉलर निर्दिष्ट करें (डिफ़ॉल्ट * सभी खोज इंजन क्रॉलर का प्रतिनिधित्व करता है)
  2. Allow क्षेत्र में क्रॉल करने की अनुमति वाले पथ भरें, प्रत्येक पंक्ति एक नियम (जैसे /, /blog/)
  3. Disallow क्षेत्र में क्रॉल करने से प्रतिबंधित पथ भरें, प्रत्येक पंक्ति एक नियम (जैसे /admin, /private)
  4. Sitemap क्षेत्र में XML साइटमैप पते जोड़ें (बहु-पंक्ति समर्थित), Host क्षेत्र में पसंदीदा डोमेन भरें
  5. दाईं ओर पूर्वावलोकन क्षेत्र रीयल-टाइम बनाई गई robots.txt सामग्री दिखाता है, पुष्टि करने के बाद कि कोई त्रुटि नहीं है, कॉपी बटन पर क्लिक करके परिनियोजित कर सकते हैं

विशेषताएं

  • बहु-नियम स्वतंत्र कॉन्फ़िगरेशन: User-agent, Allow, Disallow, Sitemap, Host के लिए अलग-अलग इनपुट क्षेत्र, नियम स्पष्ट रूप से वर्गीकृत हैं अब एक साथ मिश्रित नहीं
  • रीयल-टाइम निर्माण पूर्वावलोकन: किसी भी नियम को संशोधित करने के बाद robots.txt सामग्री तुरंत अपडेट हो जाती है, मैन्युअल रूप से जनरेट बटन पर क्लिक करने की आवश्यकता नहीं, जो आप देखते हैं वही आपको मिलता है
  • डिफ़ॉल्ट बैकअप नियम: जब Allow और Disallow दोनों खाली हों, तो स्वचालित रूप से Allow: / आउटपुट करें, खाली फ़ाइल बनने से बचें जिससे क्रॉलर व्यवहार अनिश्चित हो
  • बहु Sitemap समर्थन: Sitemap क्षेत्र बहु-पंक्ति इनपुट का समर्थन करता है, प्रत्येक URL स्वतंत्र रूप से Sitemap घोषणा की एक पंक्ति आउटपुट करता है, बहु Sitemap वाली साइटों के लिए उपयुक्त
  • एक क्लिक से कॉपी और परिनियोजन: निर्मित परिणाम एक क्लिक से क्लिपबोर्ड पर कॉपी करने का समर्थन करता है, सीधे वेबसाइट के रूट निर्देशिका में पेस्ट करके परिनियोजित करने के लिए उपयुक्त
  • डिफ़ॉल्ट उदाहरण पूर्व-भरा: पेज खुलते ही डिफ़ॉल्ट उदाहरण कॉन्फ़िगरेशन मौजूद होता है (User-agent: *, Allow: /, Disallow: /admin /private, Sitemap, Host), नए उपयोगकर्ता सीधे संशोधित कर सकते हैं
  • मानक प्रारूप आउटपुट: Robots Exclusion Protocol विनिर्देश का कड़ाई से पालन करें, User-agent पंक्ति सबसे आगे, नियम पंक्तियाँ बाद में, Sitemap/Host अंत में, सभी खोज इंजनों के साथ संगत
  • पथ स्मार्ट प्रोसेसिंग: स्वचालित रूप से प्रत्येक पंक्ति के आरंभ और अंत के रिक्त स्थान हटाएं, खाली पंक्तियों को फ़िल्टर करें, अतिरिक्त रिक्त स्थान के कारण नियम अमान्य होने से बचें
  • दो-कॉलम रिस्पॉन्सिव लेआउट: PC पर बाएं-दाएं दो कॉलम (कॉन्फ़िगरेशन/पूर्वावलोकन), मोबाइल पर ऊपर-नीचे व्यवस्थित, डेस्कटॉप और फोन दोनों पर उपयोग में आसान
  • मोनोस्पेस फ़ॉन्ट पूर्वावलोकन: पूर्वावलोकन क्षेत्र निर्मित परिणाम दिखाने के लिए मोनोस्पेस फ़ॉन्ट का उपयोग करता है, robots.txt प्रारूप साफ और स्पष्ट है
  • Host निर्देश समर्थन: Host के लिए पसंदीदा डोमेन कॉन्फ़िगर कर सकते हैं (Yandex जैसे खोज इंजन द्वारा समर्थित), डोमेन डुप्लिकेट सामग्री समस्या को कम करें
  • पूरी तरह से ब्राउज़र में स्थानीय रूप से चलता है: सभी कॉन्फ़िगरेशन और निर्माण कार्य आपके ब्राउज़र में स्थानीय JavaScript में पूरे होते हैं, किसी भी सर्वर पर डेटा नहीं भेजते
  • शून्य निर्भरता तुरंत उपयोग: पेज खुलते ही उपयोग कर सकते हैं, पंजीकरण लॉगिन की आवश्यकता नहीं, किसी भी सॉफ़्टवेयर को स्थापित करने की आवश्यकता नहीं
  • निरीक्षण टूल के साथ लिंक: संबंधित लिंक सीधे robots.txt निरीक्षण टूल पर जाते हैं, निर्माण के बाद तुरंत सत्यापित कर सकते हैं कि नियम सही है या नहीं

सामान्य प्रश्न

robots.txt किस लिए है? वेबसाइट को यह फ़ाइल क्यों चाहिए?

robots.txt वेबसाइट के रूट निर्देशिका में रखी एक सादा टेक्स्ट फ़ाइल है, जिसका उपयोग खोज इंजन क्रॉलर (जैसे Googlebot, Bingbot, Baiduspider आदि) को यह बताने के लिए किया जाता है कि कौन से पथ क्रॉल किए जा सकते हैं, कौन से एक्सेस करने से प्रतिबंधित हैं। यह Robots Exclusion Protocol (क्रॉलर अपवर्जन प्रोटोकॉल) का कार्यान्वयन तरीका है, साइट क्रॉल प्रबंधन और SEO बुनियादी सेटिंग्स की मुख्य फ़ाइल है। हालांकि अनिवार्य नहीं है, लेकिन लगभग सभी औपचारिक वेबसाइटें क्रॉलर व्यवहार को मार्गदर्शन करने के लिए robots.txt कॉन्फ़िगर करती हैं।

robots.txt फ़ाइल कहाँ रखी जानी चाहिए?

robots.txt को वेबसाइट के रूट निर्देशिका में रखा जाना चाहिए, और http://आपका डोमेन/robots.txt के माध्यम से सीधे एक्सेस किया जा सकता है। उदाहरण के लिए https://example.com/robots.txt। ध्यान दें कि इसे उपनिर्देशिका में न रखें (जैसे /blog/robots.txt अमान्य है), क्रॉलर केवल रूट निर्देशिका में यह फ़ाइल खोजता है। फ़ाइल का नाम पूरी तरह से छोटे अक्षरों में robots.txt होना चाहिए, Robots.txt या ROBOTS.TXT नहीं होना चाहिए।

जब Allow और Disallow दोनों खाली हों तो क्या सामग्री बनेगी?

जब Allow और Disallow दोनों नहीं भरे जाते हैं, तो जेनरेटर स्वचालित रूप से बैकअप नियम के रूप में Allow: / आउटपुट करेगा, जिसका अर्थ है पूरी साइट को क्रॉल करने की अनुमति देना। यह खाली फ़ाइल या केवल User-agent पंक्ति वाली अपूर्ण robots.txt बनने से बच सकता है, क्रॉलर को अस्पष्ट नियमों के कारण अनिश्चित व्यवहार करने से रोकता है।

क्या कई Sitemap पते कॉन्फ़िगर किए जा सकते हैं?

हाँ। Sitemap क्षेत्र बहु-पंक्ति इनपुट का समर्थन करता है, प्रत्येक URL स्वतंत्र रूप से Sitemap घोषणा की एक पंक्ति आउटपुट करेगा। उदाहरण के लिए बड़ी साइटों में आमतौर पर कई sitemap फ़ाइलें होती हैं (लेख sitemap, उत्पाद sitemap, छवि sitemap आदि), प्रत्येक पंक्ति पर एक पूर्ण Sitemap URL भर सकते हैं (पूर्ण पूर्ण पथ होना चाहिए, जिसमें http:// या https:// शामिल हो)।

Host निर्देश का क्या कार्य है? क्या सभी खोज इंजन इसका समर्थन करते हैं?

Host निर्देश का उपयोग साइट का पसंदीदा डोमेन (जैसे example.com या www.example.com) निर्दिष्ट करने के लिए किया जाता है, जिससे खोज इंजन मुख्य डोमेन को पहचानने में मदद मिलती है, www और गैर-www संस्करणों के बीच डुप्लिकेट सामग्री समस्या को कम करता है। वर्तमान में Host निर्देश मुख्य रूप से Yandex जैसे खोज इंजनों द्वारा समर्थित है, Google सीधे Host निर्देश का उपयोग नहीं करता है, बल्कि Google Search Console के माध्यम से पसंदीदा डोमेन सेट करता है। इसे कॉन्फ़िगर करने की सलाह दी जाती है लेकिन पूरी तरह से इस पर निर्भर न रहें।

User-agent: * का क्या अर्थ है? विशिष्ट क्रॉलर के लिए नियम कैसे कॉन्फ़िगर करें?

User-agent: * का अर्थ है कि नियम सभी क्रॉलर पर लागू होता है (तारांकन वाइल्डकार्ड है)। यदि किसी विशिष्ट खोज इंजन के लिए स्वतंत्र नियम कॉन्फ़िगर करने की आवश्यकता है, तो User-agent को विशिष्ट क्रॉलर नाम पर सेट कर सकते हैं, जैसे Googlebot (Google), Bingbot (Bing), Baiduspider (Baidu), Twitterbot (Twitter/X) आदि। कई User-agent समूह कॉन्फ़िगर कर सकते हैं, प्रत्येक समूह के बीच खाली पंक्ति से अलग करें।

क्या robots.txt वास्तव में संवेदनशील निर्देशिकाओं को एक्सेस होने से बचा सकता है?

नहीं। robots.txt केवल एक सज्जन समझौता है, अनुपालन करने वाले खोज इंजन क्रॉलर नियमों का पालन करेंगे, लेकिन दुर्भावनापूर्ण क्रॉलर, हैकर स्कैनर इसे पूरी तरह से अनदेखा कर सकते हैं। वास्तविक संवेदनशील सामग्री (जैसे बैकएंड पासवर्ड, उपयोगकर्ता गोपनीयता डेटा) की सुरक्षा के लिए robots.txt पर निर्भर न रहें, संवेदनशील निर्देशिकाओं के लिए सर्वर-साइड प्रमाणीकरण (पासवर्ड सुरक्षा, IP व्हाइटलिस्ट) जैसे वास्तविक सुरक्षा उपायों का उपयोग करना चाहिए। robots.txt का कार्य अनुपालन करने वाले क्रॉलर को मार्गदर्शन करना है, सुरक्षा सुरक्षा नहीं।

Disallow नियम का पथ मिलान नियम क्या है?

Disallow नियम उपसर्ग मिलान का उपयोग करता है: Disallow: /admin /admin, /admin/, /admin/login.html, /administrator और /admin से शुरू होने वाले सभी पथों से मेल खाएगा। यदि केवल /admin/ निर्देशिका के अंदर की सामग्री से मेल खाना चाहते हैं, तो Disallow: /admin/ लिखना चाहिए (अंतिम स्लैश के साथ)। Disallow: (खाली मान) का अर्थ है किसी भी पथ को प्रतिबंधित नहीं करना (यानी सभी की अनुमति देना)। ध्यान दें कि नियम केस-संवेदी हैं।

बनाई गई robots.txt को वेबसाइट पर कैसे परिनियोजित करें?

निर्मित सामग्री को क्लिपबोर्ड पर कॉपी करने के लिए कॉपी बटन पर क्लिक करें, फिर सर्वर पर robots.txt नामक एक सादा टेक्स्ट फ़ाइल बनाएं, सामग्री पेस्ट करें और फ़ाइल को वेबसाइट के रूट निर्देशिका में अपलोड करें (आमतौर पर web root, public_html, www या dist निर्देशिका)। परिनियोजन के बाद https://आपका डोमेन/robots.txt पर एक्सेस करके सत्यापित कर सकते हैं कि यह प्रभावी है या नहीं, या नियमों को सत्यापित करने के लिए Google Search Console के robots.txt परीक्षण टूल का उपयोग कर सकते हैं।

robots.txt को संशोधित करने के बाद कितने समय में प्रभावी होता है?

खोज इंजन क्रॉलर अगली बार आपकी वेबसाइट पर आने पर robots.txt फ़ाइल को फिर से क्रॉल करेगा, आमतौर पर कुछ घंटों से लेकर कुछ दिनों में प्रभावी होता है। यदि आप चाहते हैं कि खोज इंजन जल्द से जल्द अपडेट का पता लगाए, तो Google Search Console या Bing Webmaster Tools में robots.txt अपडेट अनुरोध सबमिट कर सकते हैं। ध्यान दें: जो पेज पहले से इंडेक्स हो चुके हैं, भले ही वे Disallow हों, कुछ समय के लिए खोज परिणामों में बने रह सकते हैं, पूरी तरह से हटाने के लिए noindex टैग या URL हटाने के टूल के साथ संयोजन की आवश्यकता होती है।

जब Allow और Disallow विरोधाभासी हों तो कौन सा प्राथमिकता लेता है?

RFC 9309 (Robots Exclusion Protocol आधिकारिक मानक) के अनुसार, जब Allow और Disallow नियम पथ लंबाई समान होती है, तो Allow Disallow से प्राथमिकता लेता है; जब पथ लंबाई भिन्न होती है, तो सबसे लंबे पथ से मेल खाने वाला नियम प्राथमिकता लेता है। उदाहरण के लिए जब Allow: /blog और Disallow: /blog/ विरोधाभासी हों, तो /blog/post.html पर एक्सेस Disallow से मेल खाएगा (पथ लंबा /blog/ > /blog), जबकि /blog पर ही एक्सेस Allow से मेल खाएगा। सीधे शब्दों में कहें, जितना विशिष्ट नियम होगा उसकी प्राथमिकता उतनी ही अधिक होगी।

क्या robots.txt में टिप्पणियां जोड़ी जा सकती हैं?

हाँ, # चिह्न से शुरू होने वाली पंक्तियाँ टिप्पणी पंक्तियाँ हैं, क्रॉलर # के बाद की सामग्री को अनदेखा कर देगा। टिप्पणियाँ अलग पंक्ति में लिखी जा सकती हैं, या नियम पंक्ति के अंत में भी लिखी जा सकती हैं (# के बाद की सामग्री)। उदाहरण के लिए: # Block admin area या Disallow: /admin # admin panel। उचित टिप्पणियां जोड़ने से आपको और टीम के सदस्यों को प्रत्येक नियम के कार्य को समझने में मदद मिलती है।

क्या Sitemap URL पूर्ण पथ होना चाहिए?

हाँ, Sitemap निर्देश को पूर्ण पूर्ण URL (प्रोटोकॉल और डोमेन सहित) का उपयोग करना चाहिए, जैसे Sitemap: https://example.com/sitemap.xml। सापेक्ष पथ (जैसे /sitemap.xml) का उपयोग नहीं किया जा सकता, क्योंकि क्रॉलर विभिन्न डोमेन (जैसे example.com और www.example.com) से आपकी साइट पर एक्सेस कर सकते हैं, सापेक्ष पथ के कारण क्रॉलर सही पता निर्धारित नहीं कर पाएगा।

क्या कॉन्फ़िगरेशन डेटा सर्वर पर अपलोड किया जाता है?

बिल्कुल नहीं। robots.txt के सभी कॉन्फ़िगरेशन और निर्माण कार्य आपके ब्राउज़र में स्थानीय रूप से JavaScript के माध्यम से पूरे होते हैं, दर्ज किए गए पथ, डोमेन जैसे कॉन्फ़िगरेशन डेटा किसी भी बाहरी सर्वर पर नहीं भेजे जाते। पेज लोड होने के बाद ऑफ़लाइन उपयोग किया जा सकता है (बुनियादी कार्यक्षमता), पेज बंद करने के बाद डेटा स्वचालित रूप से हट जाता है, कोई रिकॉर्ड नहीं छोड़ता।

क्या बनाई गई robots.txt का उपयोग किसी भी वेबसाइट पर किया जा सकता है?

हाँ, जेनरेटर मानक Robots Exclusion Protocol प्रारूप की सादा टेक्स्ट फ़ाइल आउटपुट करता है, जो किसी भी वेब सर्वर (Nginx, Apache, IIS, Caddy आदि) और किसी भी वेबसाइट निर्माण प्लेटफॉर्म (WordPress, Shopify, Next.js, Django, Rails आदि) के लिए उपयुक्त है। बस वेबसाइट के रूट निर्देशिका में परिनियोजित करें और सुनिश्चित करें कि यह सार्वजनिक रूप से एक्सेस योग्य है।

समस्या निवारण

निर्मित फ़ाइल एक्सेस करने पर 404 त्रुटि वापस आती है?

पुष्टि करें कि robots.txt फ़ाइल वेबसाइट के रूट निर्देशिका में अपलोड की गई है (उपनिर्देशिका नहीं), फ़ाइल का नाम पूरी तरह से छोटे अक्षरों में robots.txt है, फ़ाइल अनुमति सार्वजनिक रूप से पठनीय (आमतौर पर 644 अनुमति पर्याप्त है) पर सेट है। अपलोड करने के बाद ब्राउज़र में सीधे https://आपका डोमेन/robots.txt पर एक्सेस करके पुष्टि करें कि सामग्री देखी जा सकती है। विभिन्न सर्वरों की रूट निर्देशिका स्थान भिन्न होती है: Nginx/Apache आमतौर पर /var/www/html/ या /usr/share/nginx/html/ होती है, Vercel/Netlify आमतौर पर public/ निर्देशिका होती है।

Disallow नियम प्रभावी नहीं हो रहा है, पेज अभी भी इंडेक्स हो रहा है?

संभावित कारण: ①क्रॉलर ने अभी तक robots.txt को फिर से क्रॉल नहीं किया है (कुछ दिन प्रतीक्षा करें या Search Console में अपडेट सबमिट करें); ②पथ उपसर्ग मिलान सही नहीं है (जैसे Disallow: admin में / नहीं है, Disallow: /admin/ लिखना चाहिए); ③Disallow जोड़ने से पहले ही पेज इंडेक्स हो चुका था (इंडेक्स किए गए पेज स्वचालित रूप से नहीं हटते); ④दुर्भावनापूर्ण क्रॉलर robots.txt का पालन नहीं करते; ⑤Allow नियम विरोधाभासी है जो Disallow को ओवरराइड करता है (पथ लंबा होने पर Allow प्राथमिकता लेता है)। इंडेक्स को पूरी तरह से हटाने के लिए noindex टैग का उपयोग करना चाहिए।

Google Search Console रिपोर्ट करता है कि robots.txt ने पेज ब्लॉक कर दिया है?

यह आमतौर पर इसका मतलब है कि महत्वपूर्ण पेज गलती से Disallow हो गए हैं। robots.txt में जांचें कि क्या कोई बहुत व्यापक Disallow नियम है (जैसे Disallow: / या Disallow: /*?), पुष्टि करें कि CSS/JS फ़ाइलें प्रतिबंधित नहीं हैं (Google को पेज रेंडर करने के लिए इन फ़ाइलों को क्रॉल करने की आवश्यकता है)। Search Console के robots.txt परीक्षण टूल का उपयोग करके विशिष्ट URL दर्ज करके परीक्षण करें कि कौन सा नियम ब्लॉक कर रहा है।

गलती से Disallow: / सेट कर दिया जिससे पूरी साइट क्रॉल करने से प्रतिबंधित हो गई?

तुरंत उस नियम को हटाएं या संशोधित करें, robots.txt को Allow: / में बदलें या Disallow: / पंक्ति हटा दें, अपडेट की गई फ़ाइल को सर्वर पर अपलोड करें। फिर Google Search Console में robots.txt अपडेट अनुरोध सबमिट करें, और फिर से क्रॉल करने में तेजी लाने के लिए sitemap सबमिट करें। इंडेक्स से हटाए गए पेजों को फिर से इंडेक्स होने में कुछ दिनों से लेकर कुछ सप्ताह लग सकते हैं।

शब्दकोश

robots.txt
वेबसाइट के रूट निर्देशिका में रखी सादा टेक्स्ट फ़ाइल, Robots Exclusion Protocol का पालन करती है, अनुपालन करने वाले खोज इंजन क्रॉलर को यह बताने के लिए उपयोग की जाती है कि कौन से पथ क्रॉल करने की अनुमति/निषेध है।
Robots Exclusion Protocol (REP)
क्रॉलर अपवर्जन प्रोटोकॉल, 1994 में प्रस्तावित, 2022 में RFC 9309 के रूप में मानकीकृत, वेबसाइट और क्रॉलर के बीच क्रॉल नियमों के संचार के लिए वास्तविक मानक है।
User-agent
नियम समूह का प्रारंभिक फ़ील्ड, उन क्रॉलर का नाम निर्दिष्ट करता है जिन पर आगे के Allow/Disallow नियम लागू होते हैं, वाइल्डकार्ड * सभी क्रॉलर से मेल खाने का संकेत देता है।
Disallow
क्रॉल निषेध निर्देश, उन पथ उपसर्ग को निर्दिष्ट करता है जिन पर क्रॉलर एक्सेस नहीं करना चाहिए। उदाहरण के लिए Disallow: /admin /admin से शुरू होने वाले सभी पथों को क्रॉल करने से रोकता है।
Allow
क्रॉल अनुमति निर्देश, उन पथों को स्पष्ट रूप से निर्दिष्ट करता है जिन पर क्रॉलर एक्सेस कर सकता है। Disallow पैरेंट पथ के तहत विशिष्ट उपपथ खोलते समय उपयोग किया जाता है।
Sitemap
साइटमैप घोषणा निर्देश, खोज इंजन को वेबसाइट के XML साइटमैप का पूर्ण URL बताता है, जिससे क्रॉलर पूरी साइट के पेजों को कुशलतापूर्वक खोज और इंडेक्स कर सकता है।
Host
पसंदीदा डोमेन निर्देश, साइट का मुख्य डोमेन निर्दिष्ट करता है (जैसे example.com बनाम www.example.com), Yandex समर्थन करता है, Google Search Console के माध्यम से सेट करता है।
Crawler/Bot/Spider
क्रॉलर/स्पाइडर/बॉट, खोज इंजन का स्वचालित प्रोग्राम जो स्वचालित रूप से वेब पेज एक्सेस करता है और सामग्री एकत्र करता है, जैसे Googlebot, Bingbot, Baiduspider आदि।
Googlebot
Google खोज इंजन का वेब पेज क्रॉलर, Google द्वारा इंडेक्स और रैंक करने के लिए वेब पेज सामग्री क्रॉल करने के लिए जिम्मेदार, सबसे आम खोज इंजन क्रॉलर में से एक है।
Crawl Budget
क्रॉल बजट/कोटा, प्रत्येक वेबसाइट के लिए खोज इंजन द्वारा आवंटित क्रॉल आवृत्ति और पेज संख्या की सीमा। robots.txt को सही ढंग से कॉन्फ़िगर करने से क्रॉल कोटा बर्बाद होने से बचा जा सकता है।
Prefix Matching
उपसर्ग मिलान नियम, robots.txt का पथ मिलान तरीका। URL पथ नियम मान से शुरू होने पर मिलान सफल माना जाता है, जितना लंबा नियम होगा उसकी प्राथमिकता उतनी ही अधिक होगी।
noindex
HTML meta टैग या HTTP हेडर निर्देश (X-Robots-Tag: noindex), खोज इंजन को इस पेज को खोज इंडेक्स में शामिल नहीं करने के लिए कहता है। robots.txt Disallow के विपरीत, noindex इंडेक्स हटाने का अधिक विश्वसनीय तरीका है।

सामान्य खोज इंजन क्रॉलर User-agent नाम

विशिष्ट क्रॉलर नियम कॉन्फ़िगर करते समय उपयोग किए जाने वाले User-agent नाम:

क्रॉलर नामस्वामी खोज इंजनउद्देश्य
*सभी क्रॉलरवाइल्डकार्ड, अलग से कॉन्फ़िगर नहीं किए गए सभी क्रॉलर से मेल खाता है
GooglebotGoogleGoogle खोज वेब पेज क्रॉलर
BingbotBing/MicrosoftBing खोज वेब पेज क्रॉलर
BaiduspiderBaiduBaidu खोज वेब पेज क्रॉलर
YandexBotYandexYandex खोज वेब पेज क्रॉलर
GPTBotOpenAIChatGPT प्रशिक्षण डेटा क्रॉलर
TwitterbotX/TwitterX प्लेटफॉर्म लिंक कार्ड पूर्वावलोकन क्रॉलर
facebookexternalhitFacebookFacebook लिंक पूर्वावलोकन क्रॉलर

सामान्य robots.txt नियम उदाहरण

विभिन्न साइट परिदृश्यों के लिए सामान्य नियम कॉन्फ़िगरेशन:

नियमप्रभाव
Disallow: /admin//admin/ निर्देशिका के अंदर की सभी सामग्री को क्रॉल करने से रोकें
Disallow: /*?क्वेरी पैरामीटर वाले URL को क्रॉल करने से रोकें (Googlebot वाइल्डकार्ड * का समर्थन करता है)
Disallow: /searchसाइट के भीतर खोज परिणाम पेज क्रॉल करने से रोकें
Allow: /public/स्पष्ट रूप से /public/ निर्देशिका क्रॉल करने की अनुमति दें
Disallow: /⚠️ पूरी साइट को क्रॉल करने से रोकें (घातक त्रुटि, सावधानी से उपयोग करें!)
Allow: /पूरी साइट की सभी सामग्री क्रॉल करने की अनुमति दें

robots.txt मानक निर्देश त्वरित संदर्भ तालिका

RFC 9309 द्वारा परिभाषित मानक निर्देश और उपयोग:

निर्देशकार्यक्षेत्रप्रारूप उदाहरणविवरण
User-agentसमूह प्रारंभUser-agent: *नियम लागू होने वाले क्रॉलर का नाम निर्दिष्ट करें
Disallowसमूह के भीतरDisallow: /adminक्रॉल करने से प्रतिबंधित पथ उपसर्ग
Allowसमूह के भीतरAllow: /publicक्रॉल करने की अनुमति वाला पथ उपसर्ग
Sitemapगैर-समूह स्तरSitemap: https://example.com/sitemap.xmlसाइटमैप स्थान घोषित करें (पूर्ण URL)
#किसी भी स्थान# This is a commentटिप्पणी पंक्ति, क्रॉलर द्वारा अनदेखा की जाती है

Privacy & Security

इस Robots.txt जेनरेटर के सभी कार्य पूरी तरह से आपके ब्राउज़र में स्थानीय रूप से पूरे होते हैं: User-agent, पथ नियम, Sitemap, Host और अन्य कॉन्फ़िगरेशन इनपुट सभी ब्राउज़र मेमोरी में JavaScript के माध्यम से रीयल-टाइम में robots.txt टेक्स्ट को असेंबल और बनाते हैं, नेटवर्क के माध्यम से किसी भी सर्वर पर नहीं भेजे जाते। पेज लोड होने के बाद उपयोग किया जा सकता है, कुकी ट्रैकिंग का उपयोग नहीं करता, किसी भी उपयोगकर्ता डेटा को एकत्र नहीं करता। पेज बंद करने या रीफ़्रेश करने के बाद, सभी कॉन्फ़िगरेशन सामग्री स्वचालित रूप से हट जाती है, ब्राउज़र में स्थायी रूप से संग्रहीत नहीं की जाती।

Authoritative References