EMAX Studio Blog
संपूर्ण llms.txt गाइड (उदाहरणों के साथ): फ़ॉर्मैट, होस्टिंग, और AI क्रॉलर इसका उपयोग कैसे करते हैं
Manuel Mrosek · 2026-08-21 · — व्यू
संपूर्ण llms.txt गाइड (उदाहरणों के साथ): फ़ॉर्मैट, होस्टिंग, और AI क्रॉलर इसका उपयोग कैसे करते हैं
llms.txt एक सादा-टेक्स्ट मार्कडाउन फ़ाइल है जिसे आप अपने डोमेन की रूट पर रखते हैं (https://yourdomain.com/llms.txt) जो AI मॉडलों को आपकी सबसे महत्वपूर्ण सामग्री का एक साफ़, क्यूरेटेड नक्शा देती है। यह एक प्रस्तावित परंपरा है — जिसे सितंबर 2024 में Answer.AI के Jeremy Howard ने पेश किया — कोई आधिकारिक वेब मानक नहीं, और वर्तमान में कोई बड़ा AI प्रदाता इस बात की गारंटी नहीं देता कि वे इसे पढ़ते हैं या कि इसका होना आपकी रैंकिंग सुधारता है।
यह ईमानदारी शुरुआत में ही मायने रखती है, क्योंकि अधिकांश llms.txt गाइड इसे बढ़ा-चढ़ाकर बेचते हैं। यह गाइड आपको बिल्कुल सही तरीके से दिखाएगी कि फ़ाइल कैसे लिखें, इसे कहाँ होस्ट करें, यह robots.txt और sitemap.xml से कैसे संबंधित है, और आज वास्तविकता में यह क्या करता है और क्या नहीं करता। यदि आप व्यापक रणनीतिक तस्वीर चाहते हैं, तो इसके साथ हमारी गाइड अपनी वेबसाइट को AI-खोज-योग्य कैसे बनाएँ पढ़ें।
llms.txt क्या है और यह किस समस्या को हल करता है?
जब एक बड़े भाषा मॉडल को आपकी साइट के बारे में जानकारी की आवश्यकता होती है, तो उसके सामने दो समस्याएँ आती हैं। पहली, HTML पेज शोरगुल भरे होते हैं: नेविगेशन मेन्यू, कुकी बैनर, विज्ञापन, JavaScript, और फ़ुटर वास्तविक सामग्री को दबा देते हैं। दूसरी, मॉडल एक सीमित कॉन्टेक्स्ट विंडो के भीतर काम करते हैं, इसलिए वे आपकी पूरी साइट को ग्रहण नहीं कर सकते। इन्फरेंस के समय गंदे HTML को साफ़ सिग्नल में बदलना महँगा और त्रुटि-प्रवण होता है।
llms.txt मॉडल के लिए क्यूरेशन करके इसका समाधान करता है। किसी क्रॉलर को यह अनुमान लगाने देने के बजाय कि कौन-से पेज मायने रखते हैं, आप उसे एक छोटा, संरचित मार्कडाउन दस्तावेज़ थमा देते हैं जो आपके प्रमुख संसाधनों को सादी-भाषा के विवरणों के साथ सूचीबद्ध करता है। इसे उन मशीनों के लिए विशेष रूप से लिखी गई विषय-सूची समझें जो टेक्स्ट पढ़ती हैं, न कि उन ब्राउज़रों के लिए जो पिक्सेल रेंडर करते हैं।
दायरे को लेकर स्पष्ट रहना ज़रूरी है। llms.txt का लक्ष्य है इन्फरेंस-टाइम रिट्रीवल — वह क्षण जब एक AI असिस्टेंट किसी प्रश्न का उत्तर दे रहा होता है और आपके उत्पाद, दस्तावेज़ों, या नीतियों के बारे में प्रासंगिक, वर्तमान जानकारी खींचना चाहता है। इसे ट्रेनिंग-डेटा नियंत्रण तंत्र के रूप में डिज़ाइन नहीं किया गया था। वह काम अभी भी robots.txt और नए AI-विशिष्ट क्रॉलर निर्देशों का है।
llms.txt फ़ाइल फ़ॉर्मैट
विनिर्देश एक सरल, मानव-पठनीय मार्कडाउन संरचना को परिभाषित करता है। इसमें एक आवश्यक हिस्सा और कई वैकल्पिक हिस्से होते हैं, और क्रम निश्चित होता है ताकि पार्सर उस पर भरोसा कर सकें।
फ़ॉर्मैट, क्रम में:
- प्रोजेक्ट या साइट के नाम के साथ एक H1। यह एकमात्र सख़्ती से आवश्यक पंक्ति है।
- एक छोटे सारांश के साथ एक ब्लॉककोट (
>)। एक या दो वाक्य जो बताएँ कि साइट या प्रोजेक्ट क्या है। वैकल्पिक लेकिन दृढ़ता से अनुशंसित। - शून्य या अधिक अतिरिक्त संदर्भ के पैराग्राफ (कोई हेडिंग नहीं), जो मॉडल को बाकी फ़ाइल की व्याख्या के लिए ज़रूरी विवरण देते हैं।
- H2 सेक्शन, प्रत्येक में लिंक की एक मार्कडाउन सूची। प्रत्येक सूची आइटम एक हाइपरलिंक है, जिसके बाद वैकल्पिक रूप से एक कोलन और एक छोटा विवरण होता है।
- एक
## Optionalसेक्शन। यहाँ के लिंक स्पष्ट रूप से छोड़े जा सकने योग्य के रूप में चिह्नित होते हैं — तंग कॉन्टेक्स्ट बजट वाला मॉडल इन्हें कुछ भी आवश्यक खोए बिना छोड़ सकता है।
मुख्य डिज़ाइन विकल्प यह है कि सब कुछ मानक मार्कडाउन है। इसका मतलब है कि वही फ़ाइल टेक्स्ट एडिटर में किसी मनुष्य द्वारा पठनीय है और मॉडल द्वारा सहजता से पार्स करने योग्य है, क्योंकि LLM पहले से ही मार्कडाउन में धाराप्रवाह हैं।
साथी पैटर्न: llms-full.txt और .md पेज
llms.txt के साथ अक्सर दो संबंधित परंपराएँ दिखाई देती हैं:
llms-full.txt— एक एकल, बड़ी फ़ाइल जिसमें केवल लिंक नहीं बल्कि वास्तविक पूर्ण टेक्स्ट सामग्री होती है। तब उपयोगी जब आप चाहते हैं कि मॉडल के पास एक ही फ़ेच में सब कुछ हो, बहुत बड़ी फ़ाइल की क़ीमत पर।- पेजों के साफ़
.mdसंस्करण — किसी भी HTML पेज की मार्कडाउन प्रति को उसी URL पर.mdजोड़कर परोसने की प्रथा (उदाहरण के लिएabout.html.md)। आपकेllms.txtमें लिंक इन साफ़ संस्करणों की ओर इशारा कर सकते हैं ताकि किसी मॉडल को कभी HTML पार्स न करना पड़े।
सम्पूर्ण उदाहरण फ़ाइलें
यहाँ एक छोटे SaaS उत्पाद के लिए एक न्यूनतम llms.txt है। यह वह आधार है जिसे हर किसी को बना पाना चाहिए।
# Acme Analytics
> Acme Analytics is a privacy-first web analytics tool for small
> teams. It is cookieless, GDPR-compliant, and self-hostable.
Acme replaces heavyweight analytics suites with a single lightweight
script. Pricing is flat-rate per site with no event caps.
## Docs
- [Quick Start](https://acme.example/docs/quickstart.md): Install the
script and see your first data in under five minutes.
- [API Reference](https://acme.example/docs/api.md): Full REST API for
querying metrics programmatically.
- [Self-Hosting Guide](https://acme.example/docs/self-host.md): Run
Acme on your own infrastructure with Docker.
## Product
- [Features](https://acme.example/features.md): What Acme measures and
how it protects visitor privacy.
- [Pricing](https://acme.example/pricing.md): Flat monthly pricing per
tracked site.
## Optional
- [Changelog](https://acme.example/changelog.md): Release history.
- [Company](https://acme.example/about.md): Team and founding story.
एक दूसरा उदाहरण, इस बार किसी सॉफ़्टवेयर उत्पाद के बजाय एक स्थानीय सेवा व्यवसाय के लिए। ध्यान दें कि विवरण उन तथ्यों को कैसे धारण करते हैं जिनकी किसी AI असिस्टेंट को ग्राहक के प्रश्न का सीधे उत्तर देने के लिए आवश्यकता होगी।
# Harbor Dental Clinic
> Harbor Dental is a family dental practice in Portland, Oregon,
> offering general, cosmetic, and emergency dentistry since 2004.
## Services
- [General Dentistry](https://harbordental.example/general.md):
Cleanings, fillings, crowns, and preventive care.
- [Emergency Care](https://harbordental.example/emergency.md):
Same-day appointments for pain, breaks, and lost fillings.
- [Cosmetic Dentistry](https://harbordental.example/cosmetic.md):
Whitening, veneers, and Invisalign.
## Visit
- [Hours & Location](https://harbordental.example/contact.md): Open
Mon-Fri 8am-5pm at 120 Harbor St, Portland OR 97201.
- [New Patients](https://harbordental.example/new-patients.md):
Insurance accepted, intake forms, and what to expect.
## Optional
- [Patient Reviews](https://harbordental.example/reviews.md)
- [Blog](https://harbordental.example/blog.md)
एक तीसरा, बिल्कुल न्यूनतम तक घटाया गया जो फिर भी वैध है — एक H1 और एक सेक्शन। यह वैध है; एक उपयोगी फ़ाइल के लिए आपको हर सेक्शन की आवश्यकता नहीं होती।
# Jane Doe — Freelance Illustrator
> Editorial and children's book illustrator based in Berlin,
> available for commissions.
## Links
- [Portfolio](https://janedoe.example/work.md): Selected published work.
- [Rates & Contact](https://janedoe.example/contact.md): Commission
pricing and how to get in touch.
इसे कहाँ होस्ट करें
फ़ाइल को अपने डोमेन की रूट पर होस्ट करें: https://yourdomain.com/llms.txt। यह वह एकल स्थान है जिसे यह परंपरा निर्दिष्ट करती है, ठीक robots.txt की तरह। इसे किसी सबडायरेक्टरी में न रखें, और इसका नाम न बदलें — टूलिंग उसी सटीक पथ की तलाश करती है।
कुछ व्यावहारिक होस्टिंग नोट्स:
- इसे कॉन्टेंट टाइप
text/plain(याtext/markdown) के साथ परोसें; अधिकांश स्टैटिक होस्ट.txtफ़ाइल के लिए यह अपने आप करते हैं। - सुनिश्चित करें कि यह कैनोनिकल URL पर HTTP 200 लौटाता है और प्रमाणीकरण, जियोब्लॉकिंग, या किसी
robots.txtडिसअलाउ नियम द्वारा अवरुद्ध नहीं है। - यदि आप कई सबडोमेन चलाते हैं (उदाहरण के लिए
docs.औरapp.), तो प्रत्येक सबडोमेन का उस होस्ट तक सीमित अपनाllms.txtहो सकता है। - इसे वर्ज़न कंट्रोल में रखें और जब आपके महत्वपूर्ण URL बदलें तो इसे अपडेट करें, ठीक वैसे ही जैसे आप एक साइटमैप बनाए रखते हैं।
llms.txt, robots.txt और sitemap.xml से कैसे अलग है
ये तीनों फ़ाइलें डोमेन रूट पर रहती हैं और सभी स्वचालित क्लाइंटों से बात करती हैं, ठीक इसीलिए इन्हें लेकर भ्रम होता है। ये अलग-अलग समस्याओं को हल करती हैं और पूरक हैं, विकल्प नहीं। तीनों को रखें।
| पहलू | llms.txt | robots.txt | sitemap.xml |
|---|---|---|---|
| मुख्य श्रोता | AI मॉडल / LLM असिस्टेंट | खोज और क्रॉलर बॉट | खोज इंजन क्रॉलर |
| फ़ॉर्मैट | मार्कडाउन (मानव + मशीन पठनीय) | सादा-टेक्स्ट निर्देश | XML |
| उद्देश्य | इन्फरेंस-समय पठन के लिए प्रमुख सामग्री क्यूरेट करना | पथों की क्रॉलिंग की अनुमति देना या रोकना | खोज के लिए सभी इंडेक्स-योग्य URL सूचीबद्ध करना |
| विवरण शामिल हैं? | हाँ, प्रति लिंक गद्य विवरण | नहीं | नहीं (केवल URL + मेटाडेटा) |
| चयनात्मकता | अत्यधिक क्यूरेटेड, केवल जो सबसे ज़्यादा मायने रखता है | पूरी साइट के लिए नियम | व्यापक, आदर्श रूप से हर पेज |
| आधिकारिक मानक? | प्रस्तावित परंपरा, अनुमोदित नहीं | वास्तविक मानक (RFC 9309) | मान्यता प्राप्त मानक (sitemaps.org) |
| प्रदाताओं द्वारा लागू? | कोई गारंटी नहीं कि कोई प्रदाता इसे पढ़ता है | व्यापक रूप से सम्मानित | व्यापक रूप से सम्मानित |
मानसिक मॉडल: sitemap.xml कहता है "यहाँ सब कुछ है जो मौजूद है," robots.txt कहता है "यहाँ है जो आप एक्सेस कर सकते हैं और नहीं कर सकते," और llms.txt कहता है "यहाँ है जो असल में मायने रखता है और इसका अर्थ क्या है।" एक साइटमैप संपूर्ण और अवर्णित है; एक llms.txt चयनात्मक और व्याख्यायित है।
क्रॉल नियंत्रण के बारे में एक महत्वपूर्ण स्पष्टीकरण। llms.txt किसी को किसी चीज़ से नहीं रोकता — यह कोई अनुमति नहीं देता और न ही कोई वापस लेता है। यदि आप नियंत्रित करना चाहते हैं कि AI कंपनियाँ आपकी साइट को ट्रेनिंग के लिए क्रॉल करती हैं या नहीं, तो यह robots.txt उपयोगकर्ता-एजेंट नियमों (जैसे GPTBot, ClaudeBot, Google-Extended जैसे बॉट के लिए) के माध्यम से किया जाता है और, बढ़ते हुए, एक अलग प्रस्तावित ai.txt-शैली की अनुमति परत के माध्यम से। llms.txt को सहमति या ऑप्ट-आउट फ़ाइल के रूप में न लें।
AI क्रॉलर और असिस्टेंट वास्तव में इसका उपयोग कैसे करते हैं
यहीं पर ईमानदारी आवश्यक है, क्योंकि जो तकनीकी रूप से संभव है और जो उत्पादन में पुष्ट है, उनके बीच का अंतर बहुत बड़ा है।
आज क्या होता है। डेवलपर-सामना करने वाले टूल का एक बढ़ता समूह llms.txt पढ़ता है। दस्तावेज़ीकरण प्लेटफ़ॉर्म, कई AI कोडिंग असिस्टेंट और IDE इंटीग्रेशन, और कुछ रिट्रीवल फ़्रेमवर्क जब आप उन्हें किसी डोमेन की ओर इंगित करते हैं तो /llms.txt फ़ेच करेंगे, फिर इसका उपयोग यह तय करने के लिए करेंगे कि कौन-से पेज कॉन्टेक्स्ट में खींचने हैं। यदि आपने कभी किसी AI कोडिंग टूल में डॉक्स URL पेस्ट किया है और देखा है कि उसने सही रेफरेंस पेज तेज़ी से ढूँढ लिए, तो शायद इसकी वजह एक llms.txt हो।
जो पुष्ट नहीं है। इस लेखन के समय, बड़े उपभोक्ता AI खोज उत्पादों ने अपने सामान्य वेब उत्तरों में llms.txt को रैंकिंग या रिट्रीवल सिग्नल के रूप में उपयोग करने के लिए सार्वजनिक रूप से प्रतिबद्धता नहीं जताई है। कुछ बड़े प्रदाताओं के लोगों के सार्वजनिक बयान संशयपूर्ण रहे हैं, यह नोट करते हुए कि वे पहले से ही बड़े पैमाने पर HTML से सामग्री निकालते हैं। इसलिए आपको यह उम्मीद नहीं करनी चाहिए कि llms.txt प्रकाशित करना, अपने आप में, आपको किसी सामान्य-उद्देश्य AI असिस्टेंट के उत्तरों में ज़्यादा बार उद्धृत करवाएगा।
यह फिर भी करने लायक क्यों हो सकता है। क़ीमत लगभग शून्य है — यह एक छोटी मार्कडाउन फ़ाइल है — और यह प्रथा एक उपयोगी अभ्यास को मजबूर करती है: यह तय करना कि आपकी साइट के कौन-से दस या बीस URL वास्तव में आपके मूल्य का प्रतिनिधित्व करते हैं, और प्रत्येक का एक-पंक्ति का विवरण लिखना। वह स्पष्टता आपके HTML, आपके मेटाडेटा, और आपकी कॉन्टेंट रणनीति की मदद करती है, चाहे फ़ाइल कोई भी पढ़े। और यदि अपनाना बढ़ता है, तो आप पहले से ही तैयार हैं। यह वही कम-लागत, उच्च-वैकल्पिकता वाला तर्क है जो व्यापक जनरेटिव इंजन ऑप्टिमाइज़ेशन के पीछे है: आप इस बात के लिए ऑप्टिमाइज़ करते हैं कि AI सिस्टम सामग्री का उपभोग कैसे करते हैं क्योंकि खोज उसी दिशा में जा रही है।
उस सामग्री के लिए जिसे AI सिस्टम अभी पुष्ट प्रभाव के साथ पार्स करते हैं, संरचित डेटा llms.txt से ज़्यादा भारी काम करता है। हमारा विश्लेषण देखें वह स्कीमा मार्कअप जिसे AI खोज इंजन वास्तव में पढ़ते हैं — वैध स्कीमा को एक साफ़ llms.txt के साथ जोड़ना पुष्ट और उभरते दोनों चैनलों को कवर करता है।
वर्तमान अपनाव और सीमाएँ
अपेक्षाओं को संतुलित रखने के लिए, यहाँ स्थिति सादे शब्दों में है।
- यह एक प्रस्ताव है, अनिवार्यता नहीं। कोई शासी निकाय नहीं, कोई अनुरूपता परीक्षण नहीं, और इसके न होने पर कोई दंड नहीं। विनिर्देश एक सार्वजनिक रिपॉज़िटरी में रहता है और विकसित होता है।
- इसे पढ़ना उपभोक्ताओं के लिए ऑप्ट-इन है। कोई भी टूल या मॉडल जो इसे पढ़ता है, अपनी पसंद से पढ़ता है। कई नहीं पढ़ते।
- यह रैंकिंग सिग्नल नहीं है। किसी खोज या AI प्रदाता ने पुष्टि नहीं की है कि यह दृश्यता को प्रभावित करता है। इसके विपरीत किसी भी दावे को मार्केटिंग मानें, तथ्य नहीं।
- यह बहक सकता है। एक साइटमैप की तरह, एक
llms.txtजो मृत या पुराने URL की ओर इशारा करता है, किसी न होने से भी बदतर है। इसे रखरखाव की आवश्यकता होती है। - यह अच्छी सामग्री या संरचित डेटा की जगह नहीं लेता। यह एक पॉइंटर फ़ाइल है। यदि जिन पेजों की ओर यह इशारा करता है वे पतले हैं, तो पॉइंटर मदद नहीं करता।
इनमें से कोई भी बात llms.txt को एक बुरा विचार नहीं बनाती। यह इसे एक कम-जोखिम, आगे-देखने वाली स्वच्छता प्रथा बनाती है — 2006 में साइटमैप जोड़ने के ज़्यादा क़रीब, बनिस्बत एक गारंटीशुदा विकास लीवर के। इसे प्रकाशित करें, इसे सटीक रखें, और इकोसिस्टम को पकड़ने दें।
अक्सर पूछे जाने वाले प्रश्न
क्या llms.txt एक आधिकारिक वेब मानक है?
नहीं। यह एक प्रस्तावित परंपरा है जिसे सितंबर 2024 में पेश किया गया और एक सार्वजनिक विनिर्देश में बनाए रखा जाता है, लेकिन इसे W3C या IETF जैसे किसी मानक निकाय द्वारा अनुमोदित नहीं किया गया है। robots.txt के विपरीत, जो RFC 9309 के रूप में औपचारिक है, llms.txt की कोई आधिकारिक स्थिति नहीं है और कोई प्रदाता इसका समर्थन करने के लिए बाध्य नहीं है।
क्या llms.txt जोड़ने से मेरी Google या AI खोज रैंकिंग सुधरेगी?
इसका कोई प्रमाण नहीं है, और किसी बड़े प्रदाता ने इसे सामान्य वेब उत्तरों के लिए रैंकिंग या रिट्रीवल सिग्नल के रूप में पुष्ट नहीं किया है। आपको इसे इसकी कम लागत और भविष्य की संभावना के लिए जोड़ना चाहिए, SEO युक्ति के रूप में नहीं। असली दृश्यता लाभ अभी भी गुणवत्तापूर्ण सामग्री, संरचित डेटा, और तकनीकी स्वास्थ्य से आते हैं।
यदि मेरे पास llms.txt है तो क्या मुझे अब भी robots.txt और sitemap.xml की ज़रूरत है?
हाँ, बिल्कुल। तीनों फ़ाइलें अलग-अलग, पूरक उद्देश्यों की सेवा करती हैं: sitemap.xml खोज के लिए आपके सभी URL सूचीबद्ध करता है, robots.txt क्रॉलर एक्सेस और अनुमतियों को नियंत्रित करता है, और llms.txt AI पठन के लिए आपकी प्रमुख सामग्री को क्यूरेट और वर्णित करता है। llms.txt कोई अनुमति नहीं देता, इसलिए यह कभी robots.txt की जगह नहीं ले सकता।
llms.txt फ़ाइल को ठीक कहाँ रहना चाहिए?
आपके डोमेन की रूट पर, https://yourdomain.com/llms.txt पर परोसी गई, सादा-टेक्स्ट या मार्कडाउन कॉन्टेंट टाइप के साथ HTTP 200 लौटाते हुए। यह किसी सबडायरेक्टरी में या प्रमाणीकरण के पीछे नहीं होनी चाहिए। यदि आपके पास कई सबडोमेन हैं, तो प्रत्येक उस होस्ट तक सीमित अपनी फ़ाइल होस्ट कर सकता है।
llms.txt फ़ाइल कितनी लंबी होनी चाहिए?
इसे छोटा और क्यूरेटेड रखें — आमतौर पर आपके दस से तीस सबसे महत्वपूर्ण URL, प्रत्येक एक-पंक्ति के विवरण के साथ। पूरी बात चयनात्मकता की है, इसलिए हर पेज को सूचीबद्ध करने के प्रलोभन का विरोध करें। यदि आप लिंक के बजाय पूर्ण टेक्स्ट देना चाहते हैं, तो एक अलग llms-full.txt फ़ाइल का उपयोग करें ताकि प्राथमिक llms.txt एक दुबला इंडेक्स बना रहे।
आपको यह सब अकेले हाथ से लिखने और बनाए रखने की ज़रूरत नहीं है। emax.studio जैसे टूल वह AI-ऑप्टिमाइज़्ड सामग्री उत्पन्न कर सकते हैं जिसकी ओर आपके llms.txt को इशारा करना चाहिए — साफ़ पेज, संरचित सारांश, और उत्तर-प्रथम कॉपी — ताकि फ़ाइल ऐसी सामग्री से लिंक हो जो वास्तव में उद्धृत करने लायक है।
emax.studio पर अपना पहला AI-संचालित मार्केटिंग अभियान बनाएँ — मुफ़्त प्लान उपलब्ध है।
अपने AI वीडियो रील बनाने के लिए तैयार हैं?
5 मुफ़्त क्रेडिट। क्रेडिट कार्ड की आवश्यकता नहीं।
मुफ़्त में शुरू करें