EMAX Studio Blog
La guida completa a llms.txt (con esempi): formato, hosting e come i crawler AI lo usano
Manuel Mrosek · 2026-08-21 · — visualizzazioni
La guida completa a llms.txt (con esempi): formato, hosting e come i crawler AI lo usano
llms.txt è un file Markdown in testo semplice che collochi nella root del tuo dominio (https://iltuodominio.com/llms.txt) e che offre ai modelli AI una mappa pulita e curata dei tuoi contenuti più importanti. È una convenzione proposta — introdotta da Jeremy Howard di Answer.AI a settembre 2024 — non uno standard web ufficiale, e nessun grande provider AI garantisce attualmente di leggerlo o che averlo migliori i tuoi ranking.
Questa onestà fin dall'inizio è importante, perché la maggior parte delle guide su llms.txt lo sopravvaluta. Questa ti mostrerà esattamente come scrivere il file, dove ospitarlo, come si relaziona a robots.txt e sitemap.xml, e cosa realisticamente fa e non fa oggi. Se vuoi il quadro strategico più ampio, leggi accanto a questa la nostra guida su come rendere il tuo sito web individuabile dall'AI.
Cos'è llms.txt e quale problema risolve?
Quando un modello linguistico di grandi dimensioni ha bisogno di informazioni sul tuo sito, affronta due problemi. Primo, le pagine HTML sono rumorose: menu di navigazione, banner dei cookie, pubblicità, JavaScript e footer seppelliscono i contenuti reali. Secondo, i modelli lavorano all'interno di una finestra di contesto limitata, quindi non possono ingerire l'intero sito. Convertire l'HTML disordinato in un segnale pulito al momento dell'inferenza è costoso e soggetto a errori.
llms.txt affronta questo facendo la curatela per il modello. Invece di lasciare che un crawler indovini quali pagine contano, gli consegni un documento Markdown breve e strutturato che elenca le tue risorse chiave con descrizioni in linguaggio semplice. Pensalo come un indice scritto specificamente per macchine che leggono testo, non per browser che renderizzano pixel.
Vale la pena essere precisi sull'ambito. llms.txt mira al retrieval al momento dell'inferenza — il momento in cui un assistente AI sta rispondendo a una domanda e vuole attingere a informazioni pertinenti e attuali sul tuo prodotto, sulla tua documentazione o sulle tue policy. Non è stato progettato come meccanismo di controllo dei dati di addestramento. Quel compito appartiene ancora a robots.txt e alle più recenti direttive specifiche per i crawler AI.
Il formato del file llms.txt
La specifica definisce una struttura Markdown semplice e leggibile dall'uomo. Ha una parte obbligatoria e diverse parti opzionali, e l'ordinamento è fisso così che i parser possano farci affidamento.
Il formato, in ordine:
- Un H1 con il nome del progetto o del sito. Questa è l'unica riga strettamente obbligatoria.
- Un blockquote (
>) con un breve riassunto. Una o due frasi che descrivono cos'è il sito o il progetto. Opzionale ma fortemente raccomandato. - Zero o più paragrafi di contesto aggiuntivo (senza titoli), che forniscono i dettagli di cui un modello ha bisogno per interpretare il resto del file.
- Sezioni H2, ciascuna contenente un elenco Markdown di link. Ogni elemento dell'elenco è un collegamento ipertestuale, seguito facoltativamente da due punti e da una breve descrizione.
- Una sezione
## Optional. I link qui sono esplicitamente marcati come saltabili — un modello con un budget di contesto ristretto può eliminarli senza perdere nulla di essenziale.
La scelta di progettazione chiave è che tutto è Markdown standard. Ciò significa che lo stesso file è leggibile da un umano in un editor di testo e banalmente analizzabile da un modello, dato che gli LLM sono già fluenti in Markdown.
Il pattern complementare: llms-full.txt e le pagine .md
Due convenzioni correlate compaiono spesso accanto a llms.txt:
llms-full.txt— un singolo file più grande che contiene il contenuto testuale completo effettivo, non solo i link. Utile quando vuoi che un modello abbia tutto in un unico recupero, al costo di un file molto più grande.- Versioni
.mdpulite delle pagine — la pratica di servire una copia in Markdown di qualsiasi pagina HTML allo stesso URL con.mdaggiunto (per esempioabout.html.md). I link nel tuollms.txtpossono puntare a queste versioni pulite così che un modello non debba mai analizzare l'HTML.
File di esempio elaborati
Ecco un llms.txt minimale per un piccolo prodotto SaaS. Questa è la base che chiunque dovrebbe essere in grado di produrre.
# Acme Analytics
> Acme Analytics is a privacy-first web analytics tool for small
> teams. It is cookieless, GDPR-compliant, and self-hostable.
Acme replaces heavyweight analytics suites with a single lightweight
script. Pricing is flat-rate per site with no event caps.
## Docs
- [Quick Start](https://acme.example/docs/quickstart.md): Install the
script and see your first data in under five minutes.
- [API Reference](https://acme.example/docs/api.md): Full REST API for
querying metrics programmatically.
- [Self-Hosting Guide](https://acme.example/docs/self-host.md): Run
Acme on your own infrastructure with Docker.
## Product
- [Features](https://acme.example/features.md): What Acme measures and
how it protects visitor privacy.
- [Pricing](https://acme.example/pricing.md): Flat monthly pricing per
tracked site.
## Optional
- [Changelog](https://acme.example/changelog.md): Release history.
- [Company](https://acme.example/about.md): Team and founding story.
Un secondo esempio, stavolta per un'attività di servizi locale anziché un prodotto software. Nota come le descrizioni portino con sé i fatti di cui un assistente AI avrebbe bisogno per rispondere direttamente alla domanda di un cliente.
# Harbor Dental Clinic
> Harbor Dental is a family dental practice in Portland, Oregon,
> offering general, cosmetic, and emergency dentistry since 2004.
## Services
- [General Dentistry](https://harbordental.example/general.md):
Cleanings, fillings, crowns, and preventive care.
- [Emergency Care](https://harbordental.example/emergency.md):
Same-day appointments for pain, breaks, and lost fillings.
- [Cosmetic Dentistry](https://harbordental.example/cosmetic.md):
Whitening, veneers, and Invisalign.
## Visit
- [Hours & Location](https://harbordental.example/contact.md): Open
Mon-Fri 8am-5pm at 120 Harbor St, Portland OR 97201.
- [New Patients](https://harbordental.example/new-patients.md):
Insurance accepted, intake forms, and what to expect.
## Optional
- [Patient Reviews](https://harbordental.example/reviews.md)
- [Blog](https://harbordental.example/blog.md)
Un terzo, ridotto al minimo assoluto pur restando valido — un H1 e una sezione. Questo è legittimo; non hai bisogno di ogni sezione per avere un file utilizzabile.
# Jane Doe — Freelance Illustrator
> Editorial and children's book illustrator based in Berlin,
> available for commissions.
## Links
- [Portfolio](https://janedoe.example/work.md): Selected published work.
- [Rates & Contact](https://janedoe.example/contact.md): Commission
pricing and how to get in touch.
Dove ospitarlo
Ospita il file nella root del tuo dominio: https://iltuodominio.com/llms.txt. Questa è l'unica posizione che la convenzione specifica, esattamente come robots.txt. Non metterlo in una sottocartella, e non rinominarlo — gli strumenti cercano quel percorso preciso.
Alcune note pratiche sull'hosting:
- Servilo con il content type
text/plain(otext/markdown); la maggior parte degli host statici lo fa automaticamente per un file.txt. - Assicurati che restituisca HTTP 200 all'URL canonico e che non sia bloccato da autenticazione, geoblocking o una regola disallow di
robots.txt. - Se gestisci più sottodomini (per esempio
docs.eapp.), ciascun sottodominio può avere il propriollms.txtcircoscritto a quell'host. - Tienilo sotto controllo di versione e aggiornalo quando i tuoi URL importanti cambiano, allo stesso modo in cui manterresti una sitemap.
Come llms.txt si differenzia da robots.txt e sitemap.xml
Questi tre file vivono tutti nella root del dominio e parlano tutti a client automatizzati, che è esattamente il motivo per cui vengono confusi. Risolvono problemi diversi e sono complementari, non sostituti. Tienili tutti e tre.
| Aspetto | llms.txt | robots.txt | sitemap.xml |
|---|---|---|---|
| Pubblico primario | Modelli AI / assistenti LLM | Bot di ricerca e crawler | Crawler dei motori di ricerca |
| Formato | Markdown (leggibile da umano + macchina) | Direttive in testo semplice | XML |
| Scopo | Curare i contenuti chiave per la lettura in fase di inferenza | Consentire o vietare il crawling dei percorsi | Elencare tutti gli URL indicizzabili per la scoperta |
| Contiene descrizioni? | Sì, descrizioni in prosa per link | No | No (solo URL + metadati) |
| Selettività | Altamente curato, solo ciò che conta di più | Regole su tutto il sito | Completo, idealmente ogni pagina |
| Standard ufficiale? | Convenzione proposta, non ratificata | Standard di fatto (RFC 9309) | Standard riconosciuto (sitemaps.org) |
| Applicato dai provider? | Nessuna garanzia che qualche provider lo legga | Ampiamente rispettato | Ampiamente rispettato |
Il modello mentale: sitemap.xml dice "ecco tutto ciò che esiste", robots.txt dice "ecco a cosa puoi e non puoi accedere", e llms.txt dice "ecco ciò che effettivamente conta e cosa significa". Una sitemap è esaustiva e non descritta; un llms.txt è selettivo e annotato.
Un'importante precisazione sul controllo del crawl. llms.txt non blocca nessuno da niente — non concede permessi e non ne revoca alcuno. Se vuoi controllare se le aziende AI scansionano il tuo sito per l'addestramento, questo si fa tramite le regole user-agent di robots.txt (per bot come GPTBot, ClaudeBot, Google-Extended) e, sempre più, tramite uno strato di permessi separato proposto in stile ai.txt. Non trattare llms.txt come un file di consenso o opt-out.
Come i crawler e gli assistenti AI lo usano davvero
Ecco dove l'onestà è essenziale, perché il divario tra ciò che è tecnicamente possibile e ciò che è confermato in produzione è ampio.
Cosa accade oggi. Un insieme crescente di strumenti rivolti agli sviluppatori legge llms.txt. Piattaforme di documentazione, diversi assistenti di coding AI e integrazioni per IDE, e alcuni framework di retrieval recupereranno /llms.txt quando li punti verso un dominio, poi lo useranno per decidere quali pagine tirare nel contesto. Se hai mai incollato l'URL di una documentazione in uno strumento di coding AI e l'hai visto trovare velocemente le pagine di riferimento giuste, un llms.txt potrebbe esserne il motivo.
Cosa non è confermato. Al momento in cui scriviamo, i principali prodotti di ricerca AI per i consumatori non si sono impegnati pubblicamente a usare llms.txt come segnale di ranking o retrieval nelle loro risposte web generali. Le dichiarazioni pubbliche di persone presso alcuni grandi provider sono state scettiche, notando che già estraggono contenuti dall'HTML su larga scala. Quindi non dovresti aspettarti che pubblicare un llms.txt ti faccia, da solo, citare più spesso nelle risposte di un assistente AI generalista.
Perché può comunque valere la pena farlo. Il costo è prossimo allo zero — è un piccolo file Markdown — e la pratica impone un esercizio utile: decidere quali dieci o venti URL sul tuo sito rappresentano davvero il tuo valore, e scrivere una descrizione di una riga per ciascuno. Quella chiarezza aiuta il tuo HTML, i tuoi metadati e la tua strategia di contenuti, indipendentemente da chi legge il file. E se l'adozione cresce, sei già posizionato. Questa è la stessa logica a basso costo e alta opzionalità dietro la più ampia generative engine optimization: ottimizzi per come i sistemi AI consumano i contenuti perché è lì che sta andando la scoperta.
Per i contenuti che i sistemi AI analizzano proprio ora con effetto confermato, i dati strutturati fanno più lavoro pesante di llms.txt. Vedi la nostra analisi su lo schema markup che i motori di ricerca AI leggono davvero — abbinare uno schema valido a un llms.txt pulito copre sia i canali confermati sia quelli emergenti.
Adozione attuale e limitazioni
Per mantenere le aspettative calibrate, ecco lo stato dell'arte in termini chiari.
- È una proposta, non un mandato. Non c'è un organismo di governo, nessun test di conformità e nessuna penalità per non averlo. La specifica vive in un repository pubblico ed evolve.
- Leggerlo è opt-in per i consumatori. Qualsiasi strumento o modello che lo legge lo fa per scelta. Molti non lo fanno.
- Non è un segnale di ranking. Nessun provider di ricerca o AI ha confermato che influenzi la visibilità. Tratta qualsiasi affermazione contraria come marketing, non come fatto.
- Può andare alla deriva. Come una sitemap, un
llms.txtche punta a URL morti o obsoleti è peggio di nessuno. Ha bisogno di manutenzione. - Non sostituisce buoni contenuti o dati strutturati. È un file puntatore. Se le pagine a cui punta sono scarne, il puntatore non aiuta.
Nulla di tutto questo rende llms.txt una cattiva idea. Lo rende una pratica di igiene a basso rischio e orientata al futuro — più vicina all'aggiungere una sitemap nel 2006 che a una leva di crescita garantita. Pubblicalo, mantienilo accurato e lascia che l'ecosistema recuperi.
Domande frequenti
llms.txt è uno standard web ufficiale?
No. È una convenzione proposta introdotta a settembre 2024 e mantenuta in una specifica pubblica, ma non è stata ratificata da alcun organismo di standardizzazione come il W3C o l'IETF. A differenza di robots.txt, che è formalizzato come RFC 9309, llms.txt non ha uno status ufficiale e nessun provider è obbligato a supportarlo.
Aggiungere llms.txt migliorerà i miei ranking su Google o sulla ricerca AI?
Non ci sono prove che lo faccia, e nessun grande provider lo ha confermato come segnale di ranking o retrieval per le risposte web generali. Dovresti aggiungerlo per il suo basso costo e il potenziale futuro, non come tattica SEO. I veri guadagni di visibilità provengono ancora da contenuti di qualità, dati strutturati e salute tecnica.
Ho comunque bisogno di robots.txt e sitemap.xml se ho llms.txt?
Sì, assolutamente. I tre file servono a scopi diversi e complementari: sitemap.xml elenca tutti i tuoi URL per la scoperta, robots.txt controlla l'accesso e i permessi dei crawler, e llms.txt cura e descrive i tuoi contenuti chiave per la lettura dell'AI. llms.txt non concede permessi, quindi non può mai sostituire robots.txt.
Dove esattamente dovrebbe stare il file llms.txt?
Nella root del tuo dominio, servito su https://iltuodominio.com/llms.txt, restituendo HTTP 200 con un content type in testo semplice o Markdown. Non deve stare in una sottocartella o dietro autenticazione. Se hai più sottodomini, ciascuno può ospitare il proprio file circoscritto a quell'host.
Quanto dovrebbe essere lungo un file llms.txt?
Tienilo breve e curato — tipicamente i tuoi dieci-trenta URL più importanti, ciascuno con una descrizione di una riga. Tutto il senso sta nella selettività, quindi resisti alla tentazione di elencare ogni pagina. Se vuoi fornire il testo completo anziché i link, usa un file llms-full.txt separato così che il llms.txt primario resti un indice snello.
Non devi scrivere a mano e mantenere tutto questo da solo. Strumenti come emax.studio possono generare i contenuti ottimizzati per l'AI a cui il tuo llms.txt dovrebbe puntare — pagine pulite, riassunti strutturati e testi che mettono la risposta per prima — così che il file rimandi a materiale che vale davvero la pena citare.
Crea la tua prima campagna di marketing basata sull'AI su emax.studio — piano gratuito disponibile.
Pronto a creare i tuoi video reel con IA?
5 crediti gratuiti. Nessuna carta di credito.
Inizia gratis