EMAX Studio Blog
الدليل الكامل لملف llms.txt (مع أمثلة): التنسيق والاستضافة وكيف تستخدمه زواحف الذكاء الاصطناعي
Manuel Mrosek · 2026-08-21 · — مشاهدات
الدليل الكامل لملف llms.txt (مع أمثلة): التنسيق والاستضافة وكيف تستخدمه زواحف الذكاء الاصطناعي
ملف llms.txt هو ملف Markdown نصي بسيط تضعه في جذر نطاقك (https://yourdomain.com/llms.txt)، ويمنح نماذج الذكاء الاصطناعي خريطة نظيفة ومنسّقة لأهم محتوياتك. إنه اصطلاح مقترح — قدّمه Jeremy Howard من Answer.AI في سبتمبر 2024 — وليس معياراً رسمياً للويب، ولا يضمن حالياً أي مزوّد رئيسي لخدمات الذكاء الاصطناعي أنه يقرأه أو أن وجوده يحسّن ترتيبك.
هذه الصراحة منذ البداية مهمة، لأن معظم أدلة llms.txt تبالغ في تسويقه. أما هذا الدليل فسيوضّح لك بالضبط كيف تكتب الملف، وأين تستضيفه، وكيف يرتبط بـrobots.txt وsitemap.xml، وما الذي يفعله وما الذي لا يفعله واقعياً اليوم. وإذا أردت الصورة الاستراتيجية الأوسع، فاقرأ دليلنا حول كيف تجعل موقعك قابلاً للاكتشاف بواسطة الذكاء الاصطناعي جنباً إلى جنب مع هذا الدليل.
ما هو llms.txt وأي مشكلة يحل؟
عندما يحتاج نموذج لغوي كبير معلومات عن موقعك، فإنه يواجه مشكلتين. الأولى أن صفحات HTML مزدحمة بالضجيج: قوائم التنقّل، ولافتات الكوكيز، والإعلانات، وJavaScript، والتذييلات كلها تدفن المحتوى الفعلي. والثانية أن النماذج تعمل ضمن نافذة سياق محدودة، فلا تستطيع استيعاب موقعك بأكمله. وتحويل HTML الفوضوي إلى إشارة نظيفة وقت الاستدلال مكلف وعرضة للأخطاء.
يعالج llms.txt هذا الأمر بأن يقوم بالتنسيق نيابة عن النموذج. فبدلاً من ترك الزاحف يخمّن أي الصفحات مهمة، تسلّمه مستند Markdown قصيراً ومنظّماً يسرد مواردك الرئيسية مع أوصاف بلغة واضحة. اعتبره جدول محتويات مكتوباً خصيصاً للآلات التي تقرأ النصوص، لا للمتصفحات التي تعرض البكسلات.
ومن المفيد أن نكون دقيقين بشأن النطاق. يستهدف llms.txt الاسترجاع وقت الاستدلال — اللحظة التي يجيب فيها مساعد الذكاء الاصطناعي عن سؤال ويريد استحضار معلومات ملائمة وحديثة عن منتجك أو وثائقك أو سياساتك. ولم يُصمّم كآلية للتحكّم في بيانات التدريب. فهذه المهمة لا تزال من اختصاص robots.txt وتوجيهات الزواحف الأحدث الخاصة بالذكاء الاصطناعي.
تنسيق ملف llms.txt
تحدّد المواصفة بنية Markdown بسيطة وقابلة للقراءة البشرية. لها جزء مطلوب وعدة أجزاء اختيارية، والترتيب ثابت حتى تتمكّن المحلّلات من الاعتماد عليه.
التنسيق، بالترتيب:
- عنوان H1 باسم المشروع أو الموقع. وهذا هو السطر الوحيد المطلوب بشكل صارم.
- اقتباس كتلي (
>) مع ملخّص قصير. جملة أو جملتان تصفان ماهية الموقع أو المشروع. اختياري لكن يُنصح به بشدّة. - صفر أو أكثر من الفقرات من السياق الإضافي (بلا عناوين)، تقدّم التفاصيل التي يحتاجها النموذج لتفسير بقية الملف.
- أقسام H2، يحتوي كل منها على قائمة Markdown من الروابط. كل عنصر في القائمة هو رابط تشعّبي، متبوعاً اختيارياً بنقطتين ووصف قصير.
- قسم
## Optional. توضَع الروابط هنا مع تعليم صريح بأنها قابلة للتخطي — فالنموذج ذو ميزانية السياق الضيّقة يمكنه إسقاطها دون فقدان أي شيء جوهري.
الخيار التصميمي الأساسي هو أن كل شيء عبارة عن Markdown قياسي. وهذا يعني أن الملف نفسه قابل للقراءة من قبل الإنسان في محرّر نصوص، وسهل التحليل تماماً من قبل النموذج، لأن النماذج اللغوية الكبيرة تجيد Markdown أصلاً.
النمط المرافق: llms-full.txt وصفحات .md
كثيراً ما يظهر اصطلاحان مرتبطان إلى جانب llms.txt:
llms-full.txt— ملف واحد أكبر يحتوي على المحتوى النصي الكامل الفعلي، لا مجرّد روابط. مفيد عندما تريد أن يمتلك النموذج كل شيء في جلب واحد، مقابل ملف أكبر بكثير.- نسخ .md نظيفة من الصفحات — ممارسة تقديم نسخة Markdown من أي صفحة HTML على العنوان نفسه مع إضافة
.md(مثلاًabout.html.md). ويمكن للروابط فيllms.txtأن تشير إلى هذه النسخ النظيفة حتى لا يضطر النموذج أبداً إلى تحليل HTML.
ملفات مثال معالَجة
فيما يلي ملف llms.txt بسيط لمنتج SaaS صغير. هذا هو الحد الأدنى الذي ينبغي أن يكون الجميع قادرين على إنتاجه.
# Acme Analytics
> Acme Analytics is a privacy-first web analytics tool for small
> teams. It is cookieless, GDPR-compliant, and self-hostable.
Acme replaces heavyweight analytics suites with a single lightweight
script. Pricing is flat-rate per site with no event caps.
## Docs
- [Quick Start](https://acme.example/docs/quickstart.md): Install the
script and see your first data in under five minutes.
- [API Reference](https://acme.example/docs/api.md): Full REST API for
querying metrics programmatically.
- [Self-Hosting Guide](https://acme.example/docs/self-host.md): Run
Acme on your own infrastructure with Docker.
## Product
- [Features](https://acme.example/features.md): What Acme measures and
how it protects visitor privacy.
- [Pricing](https://acme.example/pricing.md): Flat monthly pricing per
tracked site.
## Optional
- [Changelog](https://acme.example/changelog.md): Release history.
- [Company](https://acme.example/about.md): Team and founding story.
مثال ثانٍ، هذه المرّة لنشاط خدمي محلّي بدلاً من منتج برمجي. لاحظ كيف تحمل الأوصاف الحقائق التي يحتاجها مساعد الذكاء الاصطناعي للإجابة عن سؤال عميل مباشرة.
# Harbor Dental Clinic
> Harbor Dental is a family dental practice in Portland, Oregon,
> offering general, cosmetic, and emergency dentistry since 2004.
## Services
- [General Dentistry](https://harbordental.example/general.md):
Cleanings, fillings, crowns, and preventive care.
- [Emergency Care](https://harbordental.example/emergency.md):
Same-day appointments for pain, breaks, and lost fillings.
- [Cosmetic Dentistry](https://harbordental.example/cosmetic.md):
Whitening, veneers, and Invisalign.
## Visit
- [Hours & Location](https://harbordental.example/contact.md): Open
Mon-Fri 8am-5pm at 120 Harbor St, Portland OR 97201.
- [New Patients](https://harbordental.example/new-patients.md):
Insurance accepted, intake forms, and what to expect.
## Optional
- [Patient Reviews](https://harbordental.example/reviews.md)
- [Blog](https://harbordental.example/blog.md)
مثال ثالث، مقتَطع إلى الحد الأدنى المطلق الذي يبقى صالحاً — عنوان H1 وقسم واحد. هذا مشروع؛ فأنت لست بحاجة إلى كل قسم لتحصل على ملف قابل للاستخدام.
# Jane Doe — Freelance Illustrator
> Editorial and children's book illustrator based in Berlin,
> available for commissions.
## Links
- [Portfolio](https://janedoe.example/work.md): Selected published work.
- [Rates & Contact](https://janedoe.example/contact.md): Commission
pricing and how to get in touch.
أين تستضيفه
استضِف الملف في جذر نطاقك: https://yourdomain.com/llms.txt. هذا هو الموقع الوحيد الذي يحدّده الاصطلاح، تماماً مثل robots.txt. لا تضعه في مجلّد فرعي، ولا تعِد تسميته — فالأدوات تبحث عن هذا المسار المحدّد بالضبط.
بعض الملاحظات العملية حول الاستضافة:
- قدّمه بنوع المحتوى
text/plain(أوtext/markdown)؛ ومعظم خوادم الاستضافة الثابتة تفعل ذلك تلقائياً لملف.txt. - تأكّد من أنه يعيد HTTP 200 على العنوان القانوني، وأنه غير محجوب بمصادقة أو حظر جغرافي أو قاعدة رفض في
robots.txt. - إذا كنت تشغّل عدّة نطاقات فرعية (مثل
docs.وapp.)، فيمكن لكل نطاق فرعي أن يمتلك ملفllms.txtخاصاً به محصوراً بذلك المضيف. - احتفظ به تحت إدارة الإصدارات وحدّثه عندما تتغيّر عناوين URL المهمة لديك، بالطريقة نفسها التي تصون بها خريطة الموقع.
كيف يختلف llms.txt عن robots.txt وsitemap.xml
هذه الملفات الثلاثة تعيش جميعها في جذر النطاق وتخاطب جميعها العملاء الآليين، وهذا بالضبط سبب الخلط بينها. لكنها تحلّ مشكلات مختلفة وهي مكمّلة لبعضها لا بديلة عنها. احتفظ بالثلاثة جميعاً.
| الجانب | llms.txt | robots.txt | sitemap.xml |
|---|---|---|---|
| الجمهور الأساسي | نماذج/مساعدات الذكاء الاصطناعي | روبوتات البحث والزحف | زواحف محرّكات البحث |
| التنسيق | Markdown (قابل للقراءة بشرياً وآلياً) | توجيهات نصية | XML |
| الغرض | تنسيق المحتوى الرئيسي للقراءة وقت الاستدلال | السماح بالزحف إلى المسارات أو منعه | سرد كل عناوين URL القابلة للفهرسة للاكتشاف |
| هل يحتوي أوصافاً؟ | نعم، أوصاف نثرية لكل رابط | لا | لا (عناوين URL + بيانات وصفية فقط) |
| الانتقائية | منسّق بعناية عالية، فقط ما هو الأهم | قواعد عبر الموقع بأكمله | شامل، يفضّل كل صفحة |
| معيار رسمي؟ | اصطلاح مقترح، غير مُصادَق عليه | معيار واقعي (RFC 9309) | معيار معترف به (sitemaps.org) |
| هل يفرضه المزوّدون؟ | لا ضمان بأن أي مزوّد يقرأه | محترَم على نطاق واسع | محترَم على نطاق واسع |
النموذج الذهني: sitemap.xml يقول «ها هو كل شيء موجود»، وrobots.txt يقول «ها هو ما يمكنك وما لا يمكنك الوصول إليه»، وllms.txt يقول «ها هو ما يهمّ فعلاً وما يعنيه». فخريطة الموقع شاملة وبلا أوصاف؛ وملف llms.txt انتقائي ومشروح.
توضيح مهم واحد بشأن التحكّم في الزحف. llms.txt لا يمنع أحداً من أي شيء — فهو لا يمنح أذونات ولا يسحبها. إذا أردت التحكّم في ما إذا كانت شركات الذكاء الاصطناعي تزحف إلى موقعك للتدريب، فذلك يتم عبر قواعد وكيل المستخدم في robots.txt (لروبوتات مثل GPTBot وClaudeBot وGoogle-Extended)، وبشكل متزايد عبر طبقة أذونات منفصلة مقترحة بنمط ai.txt. لا تعامل llms.txt بوصفه ملف موافقة أو انسحاب.
كيف تستخدمه زواحف ومساعدات الذكاء الاصطناعي فعلاً
هنا تكون الصراحة ضرورية، لأن الفجوة بين ما هو ممكن تقنياً وما هو مؤكّد في الإنتاج واسعة.
ما يحدث اليوم. مجموعة متنامية من الأدوات الموجّهة للمطوّرين تقرأ llms.txt. فمنصّات التوثيق، وعدة مساعدات برمجية للذكاء الاصطناعي وتكاملات بيئات التطوير، وبعض أطر الاسترجاع، ستجلب /llms.txt عندما توجّهها نحو نطاق، ثم تستخدمه لتقرّر أي الصفحات تسحبها إلى السياق. إن سبق أن لصقت عنوان وثائق في أداة برمجية تعمل بالذكاء الاصطناعي وشاهدتها تجد صفحات المرجع الصحيحة بسرعة، فقد يكون llms.txt هو السبب.
ما هو غير مؤكّد. حتى كتابة هذه السطور، لم تلتزم منتجات البحث الاستهلاكية الكبرى بالذكاء الاصطناعي علناً باستخدام llms.txt كإشارة ترتيب أو استرجاع في إجاباتها العامة على الويب. وقد كانت التصريحات العلنية من أشخاص في بعض المزوّدين الكبار متشكّكة، مشيرةً إلى أنهم يستخرجون المحتوى من HTML على نطاق واسع أصلاً. لذا لا ينبغي أن تتوقّع أن نشر llms.txt سيؤدي بنفسه إلى الاستشهاد بك أكثر في إجابات مساعد ذكاء اصطناعي عام الغرض.
لماذا قد يظل الأمر يستحق العناء. التكلفة تقارب الصفر — إنه ملف Markdown صغير واحد — والممارسة تفرض تمريناً مفيداً: أن تقرّر أي عشرة أو عشرين عنواناً على موقعك تمثّل قيمتك فعلاً، وأن تكتب وصفاً من سطر واحد لكل منها. هذا الوضوح يفيد HTML لديك، وبياناتك الوصفية، واستراتيجية محتواك، بغضّ النظر عمّن يقرأ الملف. وإذا نما التبنّي، فأنت في موقع مهيّأ سلفاً. وهذا هو المنطق نفسه منخفض التكلفة وعالي الخيارات وراء تحسين المحرّكات التوليدية الأوسع: أنت تحسّن لطريقة استهلاك أنظمة الذكاء الاصطناعي للمحتوى لأن هذا هو اتجاه الاكتشاف.
بالنسبة للمحتوى الذي تحلّله أنظمة الذكاء الاصطناعي الآن بأثر مؤكّد، فإن البيانات المنظّمة تؤدّي عملاً أثقل من llms.txt. راجع تفصيلنا حول ترميز المخطّط الذي تقرأه محرّكات البحث بالذكاء الاصطناعي فعلاً — فإقران مخطّط صالح مع llms.txt نظيف يغطّي القنوات المؤكّدة والناشئة معاً.
التبنّي الحالي والقيود
لإبقاء التوقّعات معايَرة، إليك حالة الأمر بعبارات صريحة.
- إنه اقتراح، لا إلزام. لا توجد هيئة حاكمة، ولا اختبار مطابقة، ولا عقوبة على عدم امتلاكه. تعيش المواصفة في مستودع عام وتتطوّر.
- قراءته اختيارية للمستهلكين. أي أداة أو نموذج يقرؤه يفعل ذلك باختياره. وكثير منها لا يفعل.
- ليس إشارة ترتيب. لم يؤكّد أي مزوّد بحث أو ذكاء اصطناعي أنه يؤثّر في الظهور. عامِل أي ادّعاء بعكس ذلك بوصفه تسويقاً لا حقيقة.
- قد ينحرف. مثل خريطة الموقع، فإن
llms.txtالذي يشير إلى عناوين URL ميتة أو قديمة أسوأ من عدم وجوده. إنه يحتاج صيانة. - لا يحل محل المحتوى الجيّد أو البيانات المنظّمة. إنه ملف مؤشّرات. فإذا كانت الصفحات التي يشير إليها هزيلة، فالمؤشّر لا يفيد.
لا شيء من هذا يجعل llms.txt فكرة سيّئة. بل يجعله ممارسة نظافة تطلّعية منخفضة المخاطر — أقرب إلى إضافة خريطة موقع في عام 2006 منها إلى رافعة نموّ مضمونة. انشره، وأبقِه دقيقاً، ودَع المنظومة تلحق بالركب.
الأسئلة الشائعة
هل llms.txt معيار ويب رسمي؟
لا. إنه اصطلاح مقترح قُدّم في سبتمبر 2024 ويُصان في مواصفة عامة، لكنه لم يُصادَق عليه من قِبل أي هيئة معايير مثل W3C أو IETF. وخلافاً لـrobots.txt، المصاغ رسمياً بوصفه RFC 9309، لا يمتلك llms.txt أي وضع رسمي، ولا يلتزم أي مزوّد بدعمه.
هل ستحسّن إضافة llms.txt ترتيبي في Google أو في البحث بالذكاء الاصطناعي؟
لا يوجد دليل على أنها تفعل ذلك، ولم يؤكّد أي مزوّد رئيسي أنها إشارة ترتيب أو استرجاع للإجابات العامة على الويب. ينبغي أن تضيفه لتكلفته المنخفضة وإمكاناته المستقبلية، لا كتكتيك لتحسين محرّكات البحث. فمكاسب الظهور الحقيقية لا تزال تأتي من المحتوى الجيّد، والبيانات المنظّمة، والصحّة التقنية.
هل ما زلت بحاجة إلى robots.txt وsitemap.xml إذا كان لديّ llms.txt؟
نعم، بالتأكيد. تخدم الملفات الثلاثة أغراضاً مختلفة ومكمّلة: sitemap.xml يسرد كل عناوين URL لديك للاكتشاف، وrobots.txt يتحكّم في وصول الزواحف وأذوناتها، وllms.txt ينسّق ويصف محتواك الرئيسي لقراءة الذكاء الاصطناعي. ولأن llms.txt لا يمنح أذونات، فلا يمكنه أبداً أن يحل محل robots.txt.
أين ينبغي أن يعيش ملف llms.txt بالضبط؟
في جذر نطاقك، مقدَّماً على https://yourdomain.com/llms.txt، مع إعادة HTTP 200 بنوع محتوى نصي أو Markdown. يجب ألا يكون في مجلّد فرعي أو خلف مصادقة. وإذا كان لديك عدّة نطاقات فرعية، فيمكن لكل منها استضافة ملفه الخاص المحصور بذلك المضيف.
ما مدى طول ملف llms.txt المفترض؟
أبقِه قصيراً ومنسّقاً — عادةً أهم عشرة إلى ثلاثين عنوان URL لديك، لكل منها وصف من سطر واحد. فجوهر الأمر هو الانتقائية، لذا قاوِم إغراء سرد كل صفحة. وإذا أردت تقديم النص الكامل بدلاً من الروابط، فاستخدم ملف llms-full.txt منفصلاً حتى يظل llms.txt الأساسي فهرساً رشيقاً.
لست مضطراً إلى كتابة كل هذا وصيانته وحدك. فأدوات مثل emax.studio يمكنها توليد المحتوى المحسّن للذكاء الاصطناعي الذي ينبغي أن يشير إليه llms.txt — صفحات نظيفة، وملخّصات منظّمة، ونصوص تبدأ بالإجابة — حتى يرتبط الملف بمواد تستحق فعلاً الاستشهاد بها.
أنشئ أول حملة تسويقية مدعومة بالذكاء الاصطناعي على emax.studio — الخطة المجانية متاحة.