EMAX Studio Blog

完整的 llms.txt 指南(含示例):格式、托管以及 AI 爬虫如何使用它

Manuel Mrosek · 2026-08-21 · 浏览量

完整的 llms.txt 指南(含示例):格式、托管以及 AI 爬虫如何使用它

llms.txt 是一个纯文本 Markdown 文件,你把它放在域名的根目录(https://yourdomain.com/llms.txt),它给 AI 模型提供一张关于你最重要内容的干净、经过精选的地图。它是一个被提议的约定——由 Answer.AI 的 Jeremy Howard 于 2024 年 9 月引入——不是一个正式的网络标准,而且目前没有任何主流 AI 提供商保证他们会读取它,或保证拥有它能改善你的排名。

开门见山的这份诚实很重要,因为大多数 llms.txt 指南把它吹过头了。这一份将向你确切展示如何撰写这个文件、把它托管在哪里、它与 robots.txtsitemap.xml 有何关系,以及它今天实际上能做什么、不能做什么。如果你想要更广的战略全局,请把我们关于如何让你的网站可被 AI 发现的指南与这一份一起阅读。

什么是 llms.txt,它解决什么问题?

当一个大语言模型需要关于你网站的信息时,它面临两个问题。第一,HTML 页面很嘈杂:导航菜单、cookie 横幅、广告、JavaScript 和页脚把真正的内容埋了起来。第二,模型在有限的上下文窗口内工作,所以它无法摄取你的整个网站。在推理时把混乱的 HTML 转换成干净的信号既昂贵又容易出错。

llms.txt 通过替模型做精选来解决这个问题。你不是让爬虫去猜哪些页面重要,而是递给它一份简短、结构化的 Markdown 文档,用平实的语言列出你的关键资源及其描述。把它想成一份专为读文本的机器(而非渲染像素的浏览器)撰写的目录。

值得精确界定它的范围。llms.txt 针对的是推理时检索——AI 助手正在回答一个问题、想要拉入关于你产品、文档或政策的相关、当前信息的那一刻。它并非被设计为一种训练数据控制机制。那份工作仍然属于 robots.txt 和更新的、针对 AI 的爬虫指令。

llms.txt 文件格式

规范定义了一个简单、人类可读的 Markdown 结构。它有一个必需部分和几个可选部分,而且顺序是固定的,好让解析器可以依赖它。

按顺序,格式如下:

  1. 一个带有项目或站点名称的 H1。 这是唯一严格必需的一行。
  2. 一个带简短摘要的引用块(>)。 用一两句话描述这个站点或项目是什么。可选,但强烈推荐。
  3. 零个或多个附加上下文段落(无标题),提供模型解读文件其余部分所需的细节。
  4. H2 章节,每个包含一个 Markdown 链接列表。 每个列表项是一个超链接,可选地跟一个冒号和一段简短描述。
  5. 一个 ## Optional 章节。 这里的链接被明确标记为可跳过——一个上下文预算紧张的模型可以丢弃它们而不损失任何本质内容。

关键的设计选择是一切都是标准 Markdown。这意味着同一个文件在文本编辑器里对人类可读,对模型也易于解析,因为 LLM 本就精通 Markdown。

配套模式:llms-full.txt 与 .md 页面

有两个相关约定常常与 llms.txt 一同出现:

  • llms-full.txt —— 一个单独的、更大的文件,包含实际的完整文本内容,而不只是链接。当你希望模型在一次抓取中拥有全部内容时很有用,代价是一个大得多的文件。
  • 页面的干净 .md 版本 —— 一种做法,在同一个 URL 后附加 .md,提供任何 HTML 页面的 Markdown 副本(例如 about.html.md)。你 llms.txt 里的链接可以指向这些干净版本,好让模型完全无需解析 HTML。

实例文件

这里是一个小型 SaaS 产品的最简 llms.txt。这是每个人都应该能够做出来的基线。

# Acme Analytics

> Acme Analytics is a privacy-first web analytics tool for small
> teams. It is cookieless, GDPR-compliant, and self-hostable.

Acme replaces heavyweight analytics suites with a single lightweight
script. Pricing is flat-rate per site with no event caps.

## Docs

- [Quick Start](https://acme.example/docs/quickstart.md): Install the
  script and see your first data in under five minutes.
- [API Reference](https://acme.example/docs/api.md): Full REST API for
  querying metrics programmatically.
- [Self-Hosting Guide](https://acme.example/docs/self-host.md): Run
  Acme on your own infrastructure with Docker.

## Product

- [Features](https://acme.example/features.md): What Acme measures and
  how it protects visitor privacy.
- [Pricing](https://acme.example/pricing.md): Flat monthly pricing per
  tracked site.

## Optional

- [Changelog](https://acme.example/changelog.md): Release history.
- [Company](https://acme.example/about.md): Team and founding story.

第二个示例,这次针对一家本地服务企业而非软件产品。注意这些描述是如何承载了一个 AI 助手直接回答客户问题所需事实的。

# Harbor Dental Clinic

> Harbor Dental is a family dental practice in Portland, Oregon,
> offering general, cosmetic, and emergency dentistry since 2004.

## Services

- [General Dentistry](https://harbordental.example/general.md):
  Cleanings, fillings, crowns, and preventive care.
- [Emergency Care](https://harbordental.example/emergency.md):
  Same-day appointments for pain, breaks, and lost fillings.
- [Cosmetic Dentistry](https://harbordental.example/cosmetic.md):
  Whitening, veneers, and Invisalign.

## Visit

- [Hours & Location](https://harbordental.example/contact.md): Open
  Mon-Fri 8am-5pm at 120 Harbor St, Portland OR 97201.
- [New Patients](https://harbordental.example/new-patients.md):
  Insurance accepted, intake forms, and what to expect.

## Optional

- [Patient Reviews](https://harbordental.example/reviews.md)
- [Blog](https://harbordental.example/blog.md)

第三个,精简到仍然有效的绝对最小值——一个 H1 和一个章节。这是合法的;你不需要每个章节都齐全才能有一个可用的文件。

# Jane Doe — Freelance Illustrator

> Editorial and children's book illustrator based in Berlin,
> available for commissions.

## Links

- [Portfolio](https://janedoe.example/work.md): Selected published work.
- [Rates & Contact](https://janedoe.example/contact.md): Commission
  pricing and how to get in touch.

托管在哪里

把文件托管在你域名的根目录https://yourdomain.com/llms.txt。这是约定所规定的唯一位置,正如 robots.txt。不要把它放进子目录,也不要重命名它——工具会寻找那个精确的路径。

几点实用的托管说明:

  • text/plain(或 text/markdown)内容类型来提供它;大多数静态托管会自动为 .txt 文件这样做。
  • 确保它在规范 URL 上返回 HTTP 200,并且没有被认证、地理封锁或某条 robots.txt 禁止规则拦住。
  • 如果你运行多个子域名(例如 docs.app.),每个子域名都可以有自己的、限定于该主机的 llms.txt
  • 把它纳入版本控制,并在你重要的 URL 变化时更新它,就像你维护一个站点地图那样。

llms.txt 与 robots.txt 和 sitemap.xml 有何不同

这三个文件都位于域名根目录,都对自动化客户端说话,这恰恰是它们被混淆的原因。它们解决不同的问题,是互补的,而非替代品。三个都保留。

方面 llms.txt robots.txt sitemap.xml
主要受众 AI 模型 / LLM 助手 搜索和爬虫机器人 搜索引擎爬虫
格式 Markdown(人类 + 机器可读) 纯文本指令 XML
用途 为推理时阅读精选关键内容 允许或禁止爬取某些路径 列出所有可索引 URL 以供发现
包含描述吗? 是,每个链接一段散文描述 否(仅 URL + 元数据)
选择性 高度精选,只放最重要的 覆盖整个站点的规则 全面,理想情况下每个页面
官方标准? 被提议的约定,未获批准 事实标准(RFC 9309) 公认标准(sitemaps.org
提供商强制执行? 不保证任何提供商读取它 被广泛遵守 被广泛遵守

心智模型是:sitemap.xml 说「这里是存在的一切」,robots.txt 说「这里是你可以不可以访问的」,而 llms.txt 说「这里是真正重要的东西以及它意味着什么」。站点地图是详尽而无描述的;llms.txt 是有选择且带注解的。

关于爬取控制有一个重要澄清。llms.txt 阻止任何人访问任何东西——它既不授予权限也不撤销权限。如果你想控制 AI 公司是否为训练而爬取你的网站,那要通过 robots.txt 的 user-agent 规则(针对像 GPTBotClaudeBotGoogle-Extended 这样的机器人)来做,而且越来越多地通过一个单独的、被提议的 ai.txt 式权限层来做。不要把 llms.txt 当作一个同意或退出文件。

AI 爬虫和助手实际上如何使用它

诚实在这里至关重要,因为技术上可能的与在生产中得到确认的之间,差距很大。

今天发生的事。 一批数量渐增的面向开发者的工具会读取 llms.txt。文档平台、若干 AI 编码助手和 IDE 集成,以及一些检索框架,会在你把它们指向一个域名时抓取 /llms.txt,然后用它来决定把哪些页面拉进上下文。如果你曾把一个文档 URL 粘进一个 AI 编码工具、并看着它快速找到正确的参考页面,那么一个 llms.txt 可能就是原因。

尚未得到确认的事。 在撰写本文时,主流的消费级 AI 搜索产品尚未公开承诺在它们的通用网络答案中把 llms.txt 用作一个排名或检索信号。来自一些大型提供商的人员的公开声明一直持怀疑态度,指出他们已经在大规模地从 HTML 中提取内容。所以你不应该指望发布一个 llms.txt 本身就会让你在一个通用 AI 助手的答案里被更频繁地引用。

为什么它仍然值得做。 成本几乎为零——它只是一个小小的 Markdown 文件——而且这个做法迫使你完成一个有用的练习:决定你网站上哪十个或二十个 URL 真正代表你的价值,并为每一个写一行描述。无论谁读这个文件,那份清晰都会帮到你的 HTML、你的元数据和你的内容策略。而且如果采用度增长,你已经占好了位置。这与更广的生成式引擎优化背后同样的低成本、高选择权逻辑一致:你为 AI 系统消费内容的方式而优化,因为发现正朝那个方向走。

对于 AI 系统当下就以确认效果解析的内容,结构化数据比 llms.txt 挑更重的担子。请看我们对AI 搜索引擎真正读取的 schema 标记的拆解——把有效的 schema 与一个干净的 llms.txt 搭配起来,覆盖了已确认的和正在兴起的两个渠道。

当前的采用度与局限

为了让期望校准,这里用平实的话讲讲现状。

  • 它是一个提案,不是一条法令。 没有管理机构、没有一致性测试、不拥有它也没有惩罚。规范存放在一个公共仓库里并会演变。
  • 对消费方来说读取它是可选的。 任何读取它的工具或模型都是自愿的。许多并不读。
  • 它不是一个排名信号。 没有搜索或 AI 提供商确认它影响可见性。请把任何相反的说法当作营销,而非事实。
  • 它会漂移。 就像站点地图一样,一个指向失效或过时 URL 的 llms.txt 比没有更糟。它需要维护。
  • 它不能替代好内容或结构化数据。 它是一个指针文件。如果它指向的页面单薄,指针也帮不上忙。

这一切都不使 llms.txt 成为一个坏主意。它使它成为一个低风险、前瞻性的卫生习惯——更接近于 2006 年添加一个站点地图,而非一根保证增长的杠杆。发布它,让它保持准确,然后让生态系统赶上来。

常见问题

llms.txt 是一个正式的网络标准吗?

不是。它是一个于 2024 年 9 月引入、维护在一份公开规范里的被提议约定,但它尚未被任何标准机构(如 W3C 或 IETF)批准。与被正式确立为 RFC 9309 的 robots.txt 不同,llms.txt 没有官方地位,也没有任何提供商有义务支持它。

添加 llms.txt 会改善我的 Google 或 AI 搜索排名吗?

没有证据表明它会,也没有主流提供商确认它是通用网络答案的一个排名或检索信号。你应该为它的低成本和未来潜力而添加它,而不是把它当作一个 SEO 战术。真正的可见性收益仍然来自优质内容、结构化数据和技术健康。

如果我有了 llms.txt,还需要 robots.txt 和 sitemap.xml 吗?

需要,绝对需要。这三个文件服务于不同、互补的用途:sitemap.xml 列出你所有的 URL 以供发现,robots.txt 控制爬虫访问和权限,而 llms.txt 为 AI 阅读精选并描述你的关键内容。llms.txt 不授予任何权限,所以它永远无法替代 robots.txt

llms.txt 文件到底应该放在哪里?

在你域名的根目录,通过 https://yourdomain.com/llms.txt 提供,返回 HTTP 200,内容类型为纯文本或 Markdown。它绝不能位于子目录或认证之后。如果你有多个子域名,每一个都可以托管自己的、限定于该主机的文件。

llms.txt 文件应该多长?

保持简短且精选——通常是你最重要的十到三十个 URL,每一个配一行描述。整个要点就是选择性,所以抵制住列出每个页面的冲动。如果你想提供完整文本而非链接,请使用一个单独的 llms-full.txt 文件,好让主 llms.txt 保持精简的索引。

你不必独自手写和维护这一切。像 emax.studio 这样的工具可以生成你 llms.txt 应该指向的、经过 AI 优化的内容——干净的页面、结构化的摘要和答案优先的文案——好让这个文件链接到真正值得引用的材料。

emax.studio 创建你的第一个 AI 驱动的营销活动——提供免费方案。

分享:

准备好创建您的AI视频了吗?

5积分免费。无需信用卡。

免费开始