EMAX Studio Blog

Der komplette llms.txt-Leitfaden (mit Beispielen): Format, Hosting und wie KI-Crawler sie nutzen

Manuel Mrosek · 2026-08-21 · Aufrufe

Der komplette llms.txt-Leitfaden (mit Beispielen): Format, Hosting und wie KI-Crawler sie nutzen

llms.txt ist eine reine Textdatei im Markdown-Format, die Sie im Wurzelverzeichnis Ihrer Domain platzieren (https://ihredomain.com/llms.txt) und die KI-Modellen eine saubere, kuratierte Karte Ihres wichtigsten Contents gibt. Es ist eine vorgeschlagene Konvention — eingeführt von Jeremy Howard von Answer.AI im September 2024 — kein offizieller Webstandard, und kein großer KI-Anbieter garantiert derzeit, dass er sie liest oder dass ihr Vorhandensein Ihre Rankings verbessert.

Diese Ehrlichkeit gleich vorweg ist wichtig, denn die meisten llms.txt-Leitfäden verkaufen sie zu hoch. Dieser hier zeigt Ihnen genau, wie Sie die Datei schreiben, wo Sie sie hosten, wie sie sich zu robots.txt und sitemap.xml verhält und was sie heute realistisch tut und nicht tut. Wenn Sie das umfassendere strategische Bild wollen, lesen Sie neben diesem unseren Leitfaden, wie Sie Ihre Website KI-auffindbar machen.

Was ist llms.txt und welches Problem löst sie?

Wenn ein großes Sprachmodell Informationen über Ihre Website braucht, steht es vor zwei Problemen. Erstens sind HTML-Seiten verrauscht: Navigationsmenüs, Cookie-Banner, Werbung, JavaScript und Footer vergraben den eigentlichen Inhalt. Zweitens arbeiten Modelle innerhalb eines begrenzten Kontextfensters, sodass sie nicht Ihre gesamte Website aufnehmen können. Unordentliches HTML zur Inferenzzeit in sauberes Signal umzuwandeln, ist teuer und fehleranfällig.

llms.txt begegnet dem, indem sie die Kuratierung für das Modell übernimmt. Statt einen Crawler raten zu lassen, welche Seiten zählen, reichen Sie ihm ein kurzes, strukturiertes Markdown-Dokument, das Ihre Schlüsselressourcen mit Beschreibungen in Alltagssprache auflistet. Betrachten Sie es als ein Inhaltsverzeichnis, das speziell für Maschinen geschrieben ist, die Text lesen, nicht für Browser, die Pixel rendern.

Es lohnt sich, beim Umfang präzise zu sein. llms.txt zielt auf Retrieval zur Inferenzzeit ab — den Moment, in dem ein KI-Assistent eine Frage beantwortet und relevante, aktuelle Informationen über Ihr Produkt, Ihre Doku oder Ihre Richtlinien einbeziehen möchte. Sie war nicht als Kontrollmechanismus für Trainingsdaten gedacht. Diese Aufgabe gehört weiterhin robots.txt und den neueren KI-spezifischen Crawler-Direktiven.

Das llms.txt-Dateiformat

Die Spezifikation definiert eine einfache, menschenlesbare Markdown-Struktur. Sie hat einen erforderlichen Teil und mehrere optionale Teile, und die Reihenfolge ist festgelegt, damit sich Parser darauf verlassen können.

Das Format, in Reihenfolge:

  1. Eine H1 mit dem Namen des Projekts oder der Website. Das ist die einzige strikt erforderliche Zeile.
  2. Ein Blockzitat (>) mit einer kurzen Zusammenfassung. Ein oder zwei Sätze, die beschreiben, was die Website oder das Projekt ist. Optional, aber dringend empfohlen.
  3. Null oder mehr Absätze zusätzlichen Kontexts (keine Überschriften), die dem Modell Details liefern, um den Rest der Datei zu interpretieren.
  4. H2-Abschnitte, jeweils mit einer Markdown-Liste von Links. Jeder Listeneintrag ist ein Hyperlink, optional gefolgt von einem Doppelpunkt und einer kurzen Beschreibung.
  5. Ein ## Optional-Abschnitt. Links hier sind explizit als überspringbar markiert — ein Modell mit knappem Kontextbudget kann sie weglassen, ohne etwas Wesentliches zu verlieren.

Die zentrale Designentscheidung ist, dass alles Standard-Markdown ist. Das bedeutet, dieselbe Datei ist von einem Menschen in einem Texteditor lesbar und von einem Modell trivial parsbar, da LLMs bereits fließend in Markdown sind.

Das Begleitmuster: llms-full.txt und .md-Seiten

Zwei verwandte Konventionen erscheinen oft neben llms.txt:

  • llms-full.txt — eine einzelne, größere Datei, die den tatsächlichen vollständigen Textinhalt enthält, nicht nur Links. Nützlich, wenn Sie möchten, dass ein Modell alles in einem Abruf hat, um den Preis einer viel größeren Datei.
  • Saubere .md-Versionen von Seiten — die Praxis, eine Markdown-Kopie jeder HTML-Seite unter derselben URL mit angehängtem .md auszuliefern (zum Beispiel about.html.md). Die Links in Ihrer llms.txt können auf diese sauberen Versionen verweisen, sodass ein Modell nie HTML parsen muss.

Ausgearbeitete Beispieldateien

Hier ist eine minimale llms.txt für ein kleines SaaS-Produkt. Das ist die Basis, die jeder produzieren können sollte.

# Acme Analytics

> Acme Analytics is a privacy-first web analytics tool for small
> teams. It is cookieless, GDPR-compliant, and self-hostable.

Acme replaces heavyweight analytics suites with a single lightweight
script. Pricing is flat-rate per site with no event caps.

## Docs

- [Quick Start](https://acme.example/docs/quickstart.md): Install the
  script and see your first data in under five minutes.
- [API Reference](https://acme.example/docs/api.md): Full REST API for
  querying metrics programmatically.
- [Self-Hosting Guide](https://acme.example/docs/self-host.md): Run
  Acme on your own infrastructure with Docker.

## Product

- [Features](https://acme.example/features.md): What Acme measures and
  how it protects visitor privacy.
- [Pricing](https://acme.example/pricing.md): Flat monthly pricing per
  tracked site.

## Optional

- [Changelog](https://acme.example/changelog.md): Release history.
- [Company](https://acme.example/about.md): Team and founding story.

Ein zweites Beispiel, diesmal für ein lokales Dienstleistungsunternehmen statt eines Softwareprodukts. Beachten Sie, wie die Beschreibungen die Fakten tragen, die ein KI-Assistent bräuchte, um eine Kundenfrage direkt zu beantworten.

# Harbor Dental Clinic

> Harbor Dental is a family dental practice in Portland, Oregon,
> offering general, cosmetic, and emergency dentistry since 2004.

## Services

- [General Dentistry](https://harbordental.example/general.md):
  Cleanings, fillings, crowns, and preventive care.
- [Emergency Care](https://harbordental.example/emergency.md):
  Same-day appointments for pain, breaks, and lost fillings.
- [Cosmetic Dentistry](https://harbordental.example/cosmetic.md):
  Whitening, veneers, and Invisalign.

## Visit

- [Hours & Location](https://harbordental.example/contact.md): Open
  Mon-Fri 8am-5pm at 120 Harbor St, Portland OR 97201.
- [New Patients](https://harbordental.example/new-patients.md):
  Insurance accepted, intake forms, and what to expect.

## Optional

- [Patient Reviews](https://harbordental.example/reviews.md)
- [Blog](https://harbordental.example/blog.md)

Ein drittes, auf das absolut gültige Minimum reduziert — eine H1 und ein Abschnitt. Das ist legitim; Sie brauchen nicht jeden Abschnitt für eine brauchbare Datei.

# Jane Doe — Freelance Illustrator

> Editorial and children's book illustrator based in Berlin,
> available for commissions.

## Links

- [Portfolio](https://janedoe.example/work.md): Selected published work.
- [Rates & Contact](https://janedoe.example/contact.md): Commission
  pricing and how to get in touch.

Wo Sie sie hosten

Hosten Sie die Datei im Wurzelverzeichnis Ihrer Domain: https://ihredomain.com/llms.txt. Das ist der einzige Ort, den die Konvention vorgibt, genau wie bei robots.txt. Legen Sie sie nicht in ein Unterverzeichnis und benennen Sie sie nicht um — Tooling sucht nach genau diesem Pfad.

Ein paar praktische Hosting-Hinweise:

  • Liefern Sie sie mit dem Content-Type text/plain (oder text/markdown) aus; die meisten statischen Hosts tun das für eine .txt-Datei automatisch.
  • Stellen Sie sicher, dass sie unter der kanonischen URL HTTP 200 zurückgibt und nicht durch Authentifizierung, Geoblocking oder eine robots.txt-Disallow-Regel blockiert ist.
  • Wenn Sie mehrere Subdomains betreiben (zum Beispiel docs. und app.), kann jede Subdomain ihre eigene, auf diesen Host beschränkte llms.txt haben.
  • Halten Sie sie in der Versionskontrolle und aktualisieren Sie sie, wenn sich Ihre wichtigen URLs ändern, so wie Sie eine Sitemap pflegen würden.

Wie sich llms.txt von robots.txt und sitemap.xml unterscheidet

Diese drei Dateien liegen alle im Wurzelverzeichnis der Domain und richten sich alle an automatisierte Clients, weshalb sie genau deshalb verwechselt werden. Sie lösen verschiedene Probleme und ergänzen sich, ersetzen sich nicht. Behalten Sie alle drei.

Aspekt llms.txt robots.txt sitemap.xml
Primäre Zielgruppe KI-Modelle / LLM-Assistenten Such- und Crawler-Bots Suchmaschinen-Crawler
Format Markdown (menschen- + maschinenlesbar) Reine Textdirektiven XML
Zweck Schlüssel-Content für das Lesen zur Inferenzzeit kuratieren Crawling von Pfaden erlauben oder verbieten Alle indexierbaren URLs zur Auffindung auflisten
Enthält Beschreibungen? Ja, Prosabeschreibungen pro Link Nein Nein (nur URLs + Metadaten)
Selektivität Stark kuratiert, nur das Wichtigste Regeln über die gesamte Website Umfassend, idealerweise jede Seite
Offizieller Standard? Vorgeschlagene Konvention, nicht ratifiziert De-facto-Standard (RFC 9309) Anerkannter Standard (sitemaps.org)
Von Anbietern durchgesetzt? Keine Garantie, dass ein Anbieter sie liest Weithin respektiert Weithin respektiert

Das gedankliche Modell: sitemap.xml sagt „hier ist alles, was existiert", robots.txt sagt „hier ist, worauf du zugreifen darfst und worauf nicht", und llms.txt sagt „hier ist, was tatsächlich zählt und was es bedeutet". Eine Sitemap ist erschöpfend und unbeschrieben; eine llms.txt ist selektiv und annotiert.

Eine wichtige Klarstellung zur Crawl-Kontrolle. llms.txt blockiert niemanden von irgendetwas — sie gewährt keine Berechtigungen und widerruft keine. Wenn Sie kontrollieren möchten, ob KI-Unternehmen Ihre Website zum Training crawlen, geschieht das über robots.txt-User-Agent-Regeln (für Bots wie GPTBot, ClaudeBot, Google-Extended) und, zunehmend, eine separate vorgeschlagene Berechtigungsebene im Stil von ai.txt. Behandeln Sie llms.txt nicht als Einwilligungs- oder Opt-out-Datei.

Wie KI-Crawler und -Assistenten sie tatsächlich nutzen

Hier ist Ehrlichkeit unerlässlich, denn die Kluft zwischen dem, was technisch möglich ist, und dem, was in der Produktion bestätigt ist, ist groß.

Was heute passiert. Ein wachsender Satz entwicklerorientierter Tools liest llms.txt. Dokumentationsplattformen, mehrere KI-Coding-Assistenten und IDE-Integrationen sowie einige Retrieval-Frameworks rufen /llms.txt ab, wenn Sie sie auf eine Domain richten, und nutzen sie dann, um zu entscheiden, welche Seiten sie in den Kontext ziehen. Wenn Sie je eine Doku-URL in ein KI-Coding-Tool eingefügt und beobachtet haben, wie es die richtigen Referenzseiten schnell fand, könnte eine llms.txt der Grund sein.

Was nicht bestätigt ist. Zum Zeitpunkt dieses Schreibens haben sich die großen KI-Suchprodukte für Verbraucher nicht öffentlich dazu verpflichtet, llms.txt als Ranking- oder Retrieval-Signal in ihren allgemeinen Webantworten zu nutzen. Öffentliche Aussagen von Personen bei einigen großen Anbietern waren skeptisch und wiesen darauf hin, dass sie Content bereits im großen Maßstab aus HTML extrahieren. Sie sollten also nicht erwarten, dass die Veröffentlichung einer llms.txt Sie von selbst häufiger in den Antworten eines Allzweck-KI-Assistenten zitiert bekommt.

Warum es sich trotzdem lohnen kann. Die Kosten sind nahezu null — es ist eine kleine Markdown-Datei — und die Praxis erzwingt eine nützliche Übung: zu entscheiden, welche zehn oder zwanzig URLs auf Ihrer Website tatsächlich Ihren Wert repräsentieren, und für jede eine einzeilige Beschreibung zu schreiben. Diese Klarheit hilft Ihrem HTML, Ihren Metadaten und Ihrer Content-Strategie, unabhängig davon, wer die Datei liest. Und wenn die Verbreitung wächst, sind Sie bereits positioniert. Das ist dieselbe kostengünstige Logik hoher Optionalität hinter der breiteren Generative Engine Optimization: Sie optimieren dafür, wie KI-Systeme Content konsumieren, weil dorthin die Auffindung geht.

Für Content, den KI-Systeme gerade jetzt mit bestätigter Wirkung parsen, leisten strukturierte Daten mehr Schwerarbeit als llms.txt. Siehe unsere Aufschlüsselung des Schema-Markups, das KI-Suchmaschinen wirklich lesen — valides Schema mit einer sauberen llms.txt zu kombinieren, deckt sowohl die bestätigten als auch die aufkommenden Kanäle ab.

Aktuelle Verbreitung und Grenzen

Um die Erwartungen kalibriert zu halten, hier der Stand der Dinge in klaren Worten.

  • Es ist ein Vorschlag, kein Mandat. Es gibt kein Leitungsgremium, keinen Konformitätstest und keine Strafe dafür, keine zu haben. Die Spezifikation lebt in einem öffentlichen Repository und entwickelt sich weiter.
  • Das Lesen ist für Konsumenten optional. Jedes Tool oder Modell, das sie liest, tut das aus freien Stücken. Viele tun es nicht.
  • Es ist kein Ranking-Signal. Kein Such- oder KI-Anbieter hat bestätigt, dass sie die Sichtbarkeit beeinflusst. Behandeln Sie jede gegenteilige Behauptung als Marketing, nicht als Fakt.
  • Sie kann veralten. Wie eine Sitemap ist eine llms.txt, die auf tote oder veraltete URLs verweist, schlimmer als keine. Sie braucht Pflege.
  • Sie ersetzt keinen guten Content oder strukturierte Daten. Sie ist eine Verweisdatei. Wenn die Seiten, auf die sie verweist, dünn sind, hilft der Verweis nicht.

Nichts davon macht llms.txt zu einer schlechten Idee. Es macht sie zu einer risikoarmen, zukunftsgerichteten Hygienepraxis — näher am Hinzufügen einer Sitemap im Jahr 2006 als an einem garantierten Wachstumshebel. Veröffentlichen Sie sie, halten Sie sie korrekt und lassen Sie das Ökosystem aufholen.

Häufig gestellte Fragen

Ist llms.txt ein offizieller Webstandard?

Nein. Es ist eine im September 2024 eingeführte und in einer öffentlichen Spezifikation gepflegte vorgeschlagene Konvention, aber sie wurde von keinem Standardisierungsgremium wie dem W3C oder der IETF ratifiziert. Anders als robots.txt, die als RFC 9309 formalisiert ist, hat llms.txt keinen offiziellen Status und kein Anbieter ist verpflichtet, sie zu unterstützen.

Wird das Hinzufügen von llms.txt meine Google- oder KI-Such-Rankings verbessern?

Es gibt keinen Beleg dafür, und kein großer Anbieter hat sie als Ranking- oder Retrieval-Signal für allgemeine Webantworten bestätigt. Sie sollten sie wegen ihrer geringen Kosten und ihres Zukunftspotenzials hinzufügen, nicht als SEO-Taktik. Echte Sichtbarkeitsgewinne kommen weiterhin von qualitativem Content, strukturierten Daten und technischer Gesundheit.

Brauche ich robots.txt und sitemap.xml noch, wenn ich llms.txt habe?

Ja, unbedingt. Die drei Dateien dienen verschiedenen, sich ergänzenden Zwecken: sitemap.xml listet all Ihre URLs zur Auffindung, robots.txt steuert Crawler-Zugriff und -Berechtigungen, und llms.txt kuratiert und beschreibt Ihren Schlüssel-Content für das KI-Lesen. llms.txt gewährt keine Berechtigungen, kann also niemals robots.txt ersetzen.

Wo genau sollte die llms.txt-Datei liegen?

Im Wurzelverzeichnis Ihrer Domain, ausgeliefert unter https://ihredomain.com/llms.txt, mit HTTP 200 und einem Content-Type für reinen Text oder Markdown. Sie darf nicht in einem Unterverzeichnis oder hinter einer Authentifizierung liegen. Wenn Sie mehrere Subdomains haben, kann jede ihre eigene, auf diesen Host beschränkte Datei hosten.

Wie lang sollte eine llms.txt-Datei sein?

Halten Sie sie kurz und kuratiert — typischerweise Ihre zehn bis dreißig wichtigsten URLs, jede mit einer einzeiligen Beschreibung. Der ganze Sinn ist Selektivität, widerstehen Sie also der Versuchung, jede Seite aufzulisten. Wenn Sie Volltext statt Links bereitstellen möchten, verwenden Sie eine separate llms-full.txt-Datei, damit die primäre llms.txt ein schlanker Index bleibt.

Sie müssen all das nicht allein von Hand schreiben und pflegen. Tools wie emax.studio können den KI-optimierten Content generieren, auf den Ihre llms.txt verweisen sollte — saubere Seiten, strukturierte Zusammenfassungen und antwortorientierter Text —, sodass die Datei auf Material verlinkt, das tatsächlich zitierwürdig ist.

Erstellen Sie Ihre erste KI-gestützte Marketingkampagne auf emax.studio — kostenloser Plan verfügbar.

Teilen:

Bereit, deine eigenen KI-Video-Reels zu erstellen?

5 kostenlose Credits. Keine Kreditkarte nötig.

Jetzt kostenlos erstellen