EMAX Studio Blog
完整的 llms.txt 指南(含示例):格式、托管以及 AI 爬虫如何使用它
Manuel Mrosek · 2026-08-21 · — 浏览量
完整的 llms.txt 指南(含示例):格式、托管以及 AI 爬虫如何使用它
llms.txt 是一个纯文本 Markdown 文件,你把它放在域名的根目录(https://yourdomain.com/llms.txt),它给 AI 模型提供一张关于你最重要内容的干净、经过精选的地图。它是一个被提议的约定——由 Answer.AI 的 Jeremy Howard 于 2024 年 9 月引入——不是一个正式的网络标准,而且目前没有任何主流 AI 提供商保证他们会读取它,或保证拥有它能改善你的排名。
开门见山的这份诚实很重要,因为大多数 llms.txt 指南把它吹过头了。这一份将向你确切展示如何撰写这个文件、把它托管在哪里、它与 robots.txt 和 sitemap.xml 有何关系,以及它今天实际上能做什么、不能做什么。如果你想要更广的战略全局,请把我们关于如何让你的网站可被 AI 发现的指南与这一份一起阅读。
什么是 llms.txt,它解决什么问题?
当一个大语言模型需要关于你网站的信息时,它面临两个问题。第一,HTML 页面很嘈杂:导航菜单、cookie 横幅、广告、JavaScript 和页脚把真正的内容埋了起来。第二,模型在有限的上下文窗口内工作,所以它无法摄取你的整个网站。在推理时把混乱的 HTML 转换成干净的信号既昂贵又容易出错。
llms.txt 通过替模型做精选来解决这个问题。你不是让爬虫去猜哪些页面重要,而是递给它一份简短、结构化的 Markdown 文档,用平实的语言列出你的关键资源及其描述。把它想成一份专为读文本的机器(而非渲染像素的浏览器)撰写的目录。
值得精确界定它的范围。llms.txt 针对的是推理时检索——AI 助手正在回答一个问题、想要拉入关于你产品、文档或政策的相关、当前信息的那一刻。它并非被设计为一种训练数据控制机制。那份工作仍然属于 robots.txt 和更新的、针对 AI 的爬虫指令。
llms.txt 文件格式
规范定义了一个简单、人类可读的 Markdown 结构。它有一个必需部分和几个可选部分,而且顺序是固定的,好让解析器可以依赖它。
按顺序,格式如下:
- 一个带有项目或站点名称的 H1。 这是唯一严格必需的一行。
- 一个带简短摘要的引用块(
>)。 用一两句话描述这个站点或项目是什么。可选,但强烈推荐。 - 零个或多个附加上下文段落(无标题),提供模型解读文件其余部分所需的细节。
- H2 章节,每个包含一个 Markdown 链接列表。 每个列表项是一个超链接,可选地跟一个冒号和一段简短描述。
- 一个
## Optional章节。 这里的链接被明确标记为可跳过——一个上下文预算紧张的模型可以丢弃它们而不损失任何本质内容。
关键的设计选择是一切都是标准 Markdown。这意味着同一个文件在文本编辑器里对人类可读,对模型也易于解析,因为 LLM 本就精通 Markdown。
配套模式:llms-full.txt 与 .md 页面
有两个相关约定常常与 llms.txt 一同出现:
llms-full.txt—— 一个单独的、更大的文件,包含实际的完整文本内容,而不只是链接。当你希望模型在一次抓取中拥有全部内容时很有用,代价是一个大得多的文件。- 页面的干净
.md版本 —— 一种做法,在同一个 URL 后附加.md,提供任何 HTML 页面的 Markdown 副本(例如about.html.md)。你llms.txt里的链接可以指向这些干净版本,好让模型完全无需解析 HTML。
实例文件
这里是一个小型 SaaS 产品的最简 llms.txt。这是每个人都应该能够做出来的基线。
# Acme Analytics
> Acme Analytics is a privacy-first web analytics tool for small
> teams. It is cookieless, GDPR-compliant, and self-hostable.
Acme replaces heavyweight analytics suites with a single lightweight
script. Pricing is flat-rate per site with no event caps.
## Docs
- [Quick Start](https://acme.example/docs/quickstart.md): Install the
script and see your first data in under five minutes.
- [API Reference](https://acme.example/docs/api.md): Full REST API for
querying metrics programmatically.
- [Self-Hosting Guide](https://acme.example/docs/self-host.md): Run
Acme on your own infrastructure with Docker.
## Product
- [Features](https://acme.example/features.md): What Acme measures and
how it protects visitor privacy.
- [Pricing](https://acme.example/pricing.md): Flat monthly pricing per
tracked site.
## Optional
- [Changelog](https://acme.example/changelog.md): Release history.
- [Company](https://acme.example/about.md): Team and founding story.
第二个示例,这次针对一家本地服务企业而非软件产品。注意这些描述是如何承载了一个 AI 助手直接回答客户问题所需事实的。
# Harbor Dental Clinic
> Harbor Dental is a family dental practice in Portland, Oregon,
> offering general, cosmetic, and emergency dentistry since 2004.
## Services
- [General Dentistry](https://harbordental.example/general.md):
Cleanings, fillings, crowns, and preventive care.
- [Emergency Care](https://harbordental.example/emergency.md):
Same-day appointments for pain, breaks, and lost fillings.
- [Cosmetic Dentistry](https://harbordental.example/cosmetic.md):
Whitening, veneers, and Invisalign.
## Visit
- [Hours & Location](https://harbordental.example/contact.md): Open
Mon-Fri 8am-5pm at 120 Harbor St, Portland OR 97201.
- [New Patients](https://harbordental.example/new-patients.md):
Insurance accepted, intake forms, and what to expect.
## Optional
- [Patient Reviews](https://harbordental.example/reviews.md)
- [Blog](https://harbordental.example/blog.md)
第三个,精简到仍然有效的绝对最小值——一个 H1 和一个章节。这是合法的;你不需要每个章节都齐全才能有一个可用的文件。
# Jane Doe — Freelance Illustrator
> Editorial and children's book illustrator based in Berlin,
> available for commissions.
## Links
- [Portfolio](https://janedoe.example/work.md): Selected published work.
- [Rates & Contact](https://janedoe.example/contact.md): Commission
pricing and how to get in touch.
托管在哪里
把文件托管在你域名的根目录:https://yourdomain.com/llms.txt。这是约定所规定的唯一位置,正如 robots.txt。不要把它放进子目录,也不要重命名它——工具会寻找那个精确的路径。
几点实用的托管说明:
- 用
text/plain(或text/markdown)内容类型来提供它;大多数静态托管会自动为.txt文件这样做。 - 确保它在规范 URL 上返回 HTTP 200,并且没有被认证、地理封锁或某条
robots.txt禁止规则拦住。 - 如果你运行多个子域名(例如
docs.和app.),每个子域名都可以有自己的、限定于该主机的llms.txt。 - 把它纳入版本控制,并在你重要的 URL 变化时更新它,就像你维护一个站点地图那样。
llms.txt 与 robots.txt 和 sitemap.xml 有何不同
这三个文件都位于域名根目录,都对自动化客户端说话,这恰恰是它们被混淆的原因。它们解决不同的问题,是互补的,而非替代品。三个都保留。
| 方面 | llms.txt | robots.txt | sitemap.xml |
|---|---|---|---|
| 主要受众 | AI 模型 / LLM 助手 | 搜索和爬虫机器人 | 搜索引擎爬虫 |
| 格式 | Markdown(人类 + 机器可读) | 纯文本指令 | XML |
| 用途 | 为推理时阅读精选关键内容 | 允许或禁止爬取某些路径 | 列出所有可索引 URL 以供发现 |
| 包含描述吗? | 是,每个链接一段散文描述 | 否 | 否(仅 URL + 元数据) |
| 选择性 | 高度精选,只放最重要的 | 覆盖整个站点的规则 | 全面,理想情况下每个页面 |
| 官方标准? | 被提议的约定,未获批准 | 事实标准(RFC 9309) | 公认标准(sitemaps.org) |
| 提供商强制执行? | 不保证任何提供商读取它 | 被广泛遵守 | 被广泛遵守 |
心智模型是:sitemap.xml 说「这里是存在的一切」,robots.txt 说「这里是你可以和不可以访问的」,而 llms.txt 说「这里是真正重要的东西以及它意味着什么」。站点地图是详尽而无描述的;llms.txt 是有选择且带注解的。
关于爬取控制有一个重要澄清。llms.txt 不阻止任何人访问任何东西——它既不授予权限也不撤销权限。如果你想控制 AI 公司是否为训练而爬取你的网站,那要通过 robots.txt 的 user-agent 规则(针对像 GPTBot、ClaudeBot、Google-Extended 这样的机器人)来做,而且越来越多地通过一个单独的、被提议的 ai.txt 式权限层来做。不要把 llms.txt 当作一个同意或退出文件。
AI 爬虫和助手实际上如何使用它
诚实在这里至关重要,因为技术上可能的与在生产中得到确认的之间,差距很大。
今天发生的事。 一批数量渐增的面向开发者的工具会读取 llms.txt。文档平台、若干 AI 编码助手和 IDE 集成,以及一些检索框架,会在你把它们指向一个域名时抓取 /llms.txt,然后用它来决定把哪些页面拉进上下文。如果你曾把一个文档 URL 粘进一个 AI 编码工具、并看着它快速找到正确的参考页面,那么一个 llms.txt 可能就是原因。
尚未得到确认的事。 在撰写本文时,主流的消费级 AI 搜索产品尚未公开承诺在它们的通用网络答案中把 llms.txt 用作一个排名或检索信号。来自一些大型提供商的人员的公开声明一直持怀疑态度,指出他们已经在大规模地从 HTML 中提取内容。所以你不应该指望发布一个 llms.txt 本身就会让你在一个通用 AI 助手的答案里被更频繁地引用。
为什么它仍然值得做。 成本几乎为零——它只是一个小小的 Markdown 文件——而且这个做法迫使你完成一个有用的练习:决定你网站上哪十个或二十个 URL 真正代表你的价值,并为每一个写一行描述。无论谁读这个文件,那份清晰都会帮到你的 HTML、你的元数据和你的内容策略。而且如果采用度增长,你已经占好了位置。这与更广的生成式引擎优化背后同样的低成本、高选择权逻辑一致:你为 AI 系统消费内容的方式而优化,因为发现正朝那个方向走。
对于 AI 系统当下就以确认效果解析的内容,结构化数据比 llms.txt 挑更重的担子。请看我们对AI 搜索引擎真正读取的 schema 标记的拆解——把有效的 schema 与一个干净的 llms.txt 搭配起来,覆盖了已确认的和正在兴起的两个渠道。
当前的采用度与局限
为了让期望校准,这里用平实的话讲讲现状。
- 它是一个提案,不是一条法令。 没有管理机构、没有一致性测试、不拥有它也没有惩罚。规范存放在一个公共仓库里并会演变。
- 对消费方来说读取它是可选的。 任何读取它的工具或模型都是自愿的。许多并不读。
- 它不是一个排名信号。 没有搜索或 AI 提供商确认它影响可见性。请把任何相反的说法当作营销,而非事实。
- 它会漂移。 就像站点地图一样,一个指向失效或过时 URL 的
llms.txt比没有更糟。它需要维护。 - 它不能替代好内容或结构化数据。 它是一个指针文件。如果它指向的页面单薄,指针也帮不上忙。
这一切都不使 llms.txt 成为一个坏主意。它使它成为一个低风险、前瞻性的卫生习惯——更接近于 2006 年添加一个站点地图,而非一根保证增长的杠杆。发布它,让它保持准确,然后让生态系统赶上来。
常见问题
llms.txt 是一个正式的网络标准吗?
不是。它是一个于 2024 年 9 月引入、维护在一份公开规范里的被提议约定,但它尚未被任何标准机构(如 W3C 或 IETF)批准。与被正式确立为 RFC 9309 的 robots.txt 不同,llms.txt 没有官方地位,也没有任何提供商有义务支持它。
添加 llms.txt 会改善我的 Google 或 AI 搜索排名吗?
没有证据表明它会,也没有主流提供商确认它是通用网络答案的一个排名或检索信号。你应该为它的低成本和未来潜力而添加它,而不是把它当作一个 SEO 战术。真正的可见性收益仍然来自优质内容、结构化数据和技术健康。
如果我有了 llms.txt,还需要 robots.txt 和 sitemap.xml 吗?
需要,绝对需要。这三个文件服务于不同、互补的用途:sitemap.xml 列出你所有的 URL 以供发现,robots.txt 控制爬虫访问和权限,而 llms.txt 为 AI 阅读精选并描述你的关键内容。llms.txt 不授予任何权限,所以它永远无法替代 robots.txt。
llms.txt 文件到底应该放在哪里?
在你域名的根目录,通过 https://yourdomain.com/llms.txt 提供,返回 HTTP 200,内容类型为纯文本或 Markdown。它绝不能位于子目录或认证之后。如果你有多个子域名,每一个都可以托管自己的、限定于该主机的文件。
llms.txt 文件应该多长?
保持简短且精选——通常是你最重要的十到三十个 URL,每一个配一行描述。整个要点就是选择性,所以抵制住列出每个页面的冲动。如果你想提供完整文本而非链接,请使用一个单独的 llms-full.txt 文件,好让主 llms.txt 保持精简的索引。
你不必独自手写和维护这一切。像 emax.studio 这样的工具可以生成你 llms.txt 应该指向的、经过 AI 优化的内容——干净的页面、结构化的摘要和答案优先的文案——好让这个文件链接到真正值得引用的材料。
在 emax.studio 创建你的第一个 AI 驱动的营销活动——提供免费方案。