Robots.txt जनरेटर
हर बॉट के लिए allow और disallow नियमों, sitemap लिंक और crawl delay के साथ robots.txt फ़ाइल बनाएं। WordPress और ऑनलाइन शॉप के प्रीसेट, वैलिडेशन के साथ।
Robots.txt जनरेटर लोड हो रहा है…
आपकी फ़ाइलें कभी आपके डिवाइस से बाहर नहीं जातीं
Robots.txt जनरेटर का इस्तेमाल कैसे करें
- 1
इस पेज पर Robots.txt जनरेटर खोलें। यह सीधे आपके ब्राउज़र में लोड होता है।
- 2
अपनी फ़ाइल, टेक्स्ट या वैल्यू जोड़ें और सेटिंग बदलें।
- 3
नतीजा कॉपी या डाउनलोड करें। कुछ भी अपलोड या स्टोर नहीं होता।
इस टूल के बारे में
robots.txt फ़ाइल आपकी वेबसाइट के रूट में रहती है और सर्च इंजन क्रॉलर को बताती है कि वे साइट के किन हिस्सों पर जा सकते हैं। यह robots.txt जनरेटर एक आसान फ़ॉर्म से आपके लिए फ़ाइल बनाता है: बॉट चुनें, allow और disallow नियम जोड़ें, अपना sitemap लिंक करें, और ऐसी फ़ाइल कॉपी या डाउनलोड करें जिसकी ग़लतियां साथ-साथ जांची जाती हैं।
robots.txt फ़ाइल कैसे बनाएं
- किसी प्रीसेट से शुरू करें: Open to all, Block all, WordPress या E-commerce।
- user agents चुनें: सभी बॉट (*), या ख़ास बॉट जैसे Googlebot, Bingbot, DuckDuckBot, YandexBot, Baiduspider, Slurp, facebookexternalhit, Twitterbot, LinkedInBot या कोई कस्टम नाम।
- पाथ के लिए Disallow और Allow नियम जोड़ें, या ब्लॉक करने के लिए आम पाथ में से चुनें।
- अपना sitemap URL जोड़ें और ज़रूरत हो तो crawl delay और पसंदीदा host भी।
- वैलिडेशन और प्रीव्यू जांचें, फिर robots.txt डाउनलोड करके अपनी साइट के रूट में अपलोड करें।
सिंटैक्स संक्षेप में
| नियम | मतलब |
|---|---|
| User-agent: * | नीचे के नियम सभी बॉट पर लागू होते हैं |
| Disallow: /admin/ | /admin/ के अंदर कुछ भी क्रॉल न करें |
| Allow: /admin/help | किसी बड़े Disallow का अपवाद |
| Disallow: /*.pdf$ | .pdf पर ख़त्म होने वाले सभी URL ब्लॉक करें |
| Disallow: /*? | पैरामीटर वाले URL ब्लॉक करें |
| Sitemap: https://example.com/sitemap.xml | आपका sitemap कहां है |
ज़रूरी बातें
- Robots.txt क्रॉलिंग नियंत्रित करता है, इंडेक्सिंग नहीं। ब्लॉक किया गया पेज भी Google में दिख सकता है अगर दूसरी साइटें उससे लिंक करती हैं। किसी पेज को सर्च रिज़ल्ट से बाहर रखने के लिए noindex मेटा टैग इस्तेमाल करें और उसे क्रॉल होने दें।
- यह सुरक्षा नहीं है। फ़ाइल सार्वजनिक है और कोई भी इसे पढ़ सकता है। निजी हिस्सों को लॉगिन से सुरक्षित रखें।
- CSS, JavaScript या इमेज ब्लॉक न करें जिनकी आपके पेजों को ज़रूरत है; Google पेज रेंडर करता है और वरना उनका ग़लत आकलन कर सकता है।
- Google Crawl-delay को अनदेखा करता है; Bing और कुछ अन्य इसका पालन करते हैं।
- हर host के लिए एक फ़ाइल, https://yourdomain.com/robots.txt पर, नाम छोटे अक्षरों में।
अपलोड के बाद Google Search Console में फ़ाइल टेस्ट करें। फिर XML sitemap जनरेटर से sitemap बनाएं और मेटा टैग जनरेटर से हर पेज के लिए सही टैग सेट करें।
अक्सर पूछे जाने वाले सवाल
robots.txt फ़ाइल कहां रखूं?
अपने डोमेन के रूट में, ताकि वह https://yourdomain.com/robots.txt पर मिले। हर सबडोमेन को अपनी अलग फ़ाइल चाहिए।
क्या robots.txt किसी पेज को Google में दिखने से रोकता है?
नहीं। यह क्रॉलिंग रोकता है, इंडेक्सिंग नहीं। पेज पर noindex मेटा टैग लगाएं और उसे robots.txt में ब्लॉक न करें, ताकि Google noindex देख सके।
सभी बॉट को कैसे ब्लॉक करूं?
Block all प्रीसेट इस्तेमाल करें, जो User-agent: * के बाद Disallow: / लिखता है। इसे सिर्फ़ स्टेजिंग या निजी साइटों के लिए इस्तेमाल करें।
Allow और Disallow में क्या अंतर है?
Disallow किसी पाथ को ब्लॉक करता है; Allow ब्लॉक किए गए पाथ के अंदर अपवाद बनाता है। नियम आपस में टकराएं तो Google सबसे सटीक नियम मानता है।
क्या robots.txt में अपना sitemap जोड़ना चाहिए?
हां। Search Console में सबमिट करने के साथ-साथ Sitemap लाइन सभी सर्च इंजनों को उसे ढूंढने में मदद करती है।
क्या AI क्रॉलर ब्लॉक कर सकते हैं?
हां। GPTBot या CCBot जैसा कस्टम user agent Disallow: / के साथ जोड़ें। अच्छे बॉट इसका पालन करते हैं; बाक़ी शायद न करें।
