EMAX Studio Blog
O Guia Completo do llms.txt (Com Exemplos): Formato, Alojamento e Como os Rastreadores de IA o Usam
Manuel Mrosek · 2026-08-21 · — visualizacoes
O Guia Completo do llms.txt (Com Exemplos): Formato, Alojamento e Como os Rastreadores de IA o Usam
O llms.txt é um ficheiro de texto simples em Markdown que coloca na raiz do seu domínio (https://oseudominio.com/llms.txt) e que dá aos modelos de IA um mapa limpo e curado do seu conteúdo mais importante. É uma convenção proposta — introduzida por Jeremy Howard, da Answer.AI, em setembro de 2024 — e não um padrão oficial da web, e nenhum grande fornecedor de IA garante atualmente que o lê ou que tê-lo melhora as suas posições.
Essa honestidade logo de início importa, porque a maioria dos guias de llms.txt vende-o em excesso. Este vai mostrar-lhe exatamente como escrever o ficheiro, onde alojá-lo, como se relaciona com o robots.txt e o sitemap.xml, e o que realisticamente faz e não faz hoje. Se quiser o quadro estratégico mais amplo, leia o nosso guia sobre como tornar o seu site detetável pela IA juntamente com este.
O Que É o llms.txt e Que Problema Resolve?
Quando um grande modelo de linguagem precisa de informação sobre o seu site, enfrenta dois problemas. Primeiro, as páginas HTML são ruidosas: menus de navegação, avisos de cookies, anúncios, JavaScript e rodapés enterram o conteúdo real. Segundo, os modelos trabalham dentro de uma janela de contexto limitada, por isso não conseguem ingerir o seu site inteiro. Converter HTML confuso em sinal limpo no momento da inferência é dispendioso e propenso a erros.
O llms.txt resolve isto fazendo a curadoria pelo modelo. Em vez de deixar um rastreador adivinhar que páginas importam, entrega-lhe um documento Markdown curto e estruturado que lista os seus recursos-chave com descrições em linguagem simples. Pense nele como um índice escrito especificamente para máquinas que leem texto, e não para navegadores que renderizam píxeis.
Vale a pena ser preciso quanto ao âmbito. O llms.txt destina-se à recuperação no momento da inferência — o momento em que um assistente de IA está a responder a uma pergunta e quer trazer informação relevante e atual sobre o seu produto, a sua documentação ou as suas políticas. Não foi concebido como mecanismo de controlo dos dados de treino. Esse trabalho continua a pertencer ao robots.txt e às mais recentes diretivas específicas para rastreadores de IA.
O Formato do Ficheiro llms.txt
A especificação define uma estrutura Markdown simples e legível por humanos. Tem uma parte obrigatória e várias partes opcionais, e a ordem é fixa para que os analisadores possam confiar nela.
O formato, por ordem:
- Um H1 com o nome do projeto ou site. Esta é a única linha estritamente obrigatória.
- Uma citação em bloco (
>) com um breve resumo. Uma ou duas frases a descrever o que o site ou projeto é. Opcional, mas fortemente recomendado. - Zero ou mais parágrafos de contexto adicional (sem títulos), fornecendo o detalhe de que um modelo precisa para interpretar o resto do ficheiro.
- Secções H2, cada uma contendo uma lista Markdown de links. Cada item da lista é uma hiperligação, opcionalmente seguida de dois pontos e de uma breve descrição.
- Uma secção
## Optional. Os links aqui estão explicitamente marcados como dispensáveis — um modelo com um orçamento de contexto apertado pode descartá-los sem perder nada essencial.
A escolha de conceção fundamental é que tudo é Markdown padrão. Isso significa que o mesmo ficheiro é legível por um humano num editor de texto e trivialmente analisável por um modelo, uma vez que os LLM já são fluentes em Markdown.
O Padrão Complementar: llms-full.txt e Páginas .md
Duas convenções relacionadas surgem frequentemente a par do llms.txt:
llms-full.txt— um único ficheiro maior que contém o conteúdo de texto completo real, não apenas links. Útil quando quer que um modelo tenha tudo numa só recolha, ao custo de um ficheiro muito maior.- Versões
.mdlimpas das páginas — a prática de servir uma cópia Markdown de qualquer página HTML no mesmo URL com.mdacrescentado (por exemploabout.html.md). Os links no seullms.txtpodem apontar para estas versões limpas, para que um modelo nunca tenha de analisar HTML.
Ficheiros de Exemplo Trabalhados
Eis um llms.txt mínimo para um pequeno produto SaaS. Esta é a base que toda a gente deveria conseguir produzir.
# Acme Analytics
> Acme Analytics is a privacy-first web analytics tool for small
> teams. It is cookieless, GDPR-compliant, and self-hostable.
Acme replaces heavyweight analytics suites with a single lightweight
script. Pricing is flat-rate per site with no event caps.
## Docs
- [Quick Start](https://acme.example/docs/quickstart.md): Install the
script and see your first data in under five minutes.
- [API Reference](https://acme.example/docs/api.md): Full REST API for
querying metrics programmatically.
- [Self-Hosting Guide](https://acme.example/docs/self-host.md): Run
Acme on your own infrastructure with Docker.
## Product
- [Features](https://acme.example/features.md): What Acme measures and
how it protects visitor privacy.
- [Pricing](https://acme.example/pricing.md): Flat monthly pricing per
tracked site.
## Optional
- [Changelog](https://acme.example/changelog.md): Release history.
- [Company](https://acme.example/about.md): Team and founding story.
Um segundo exemplo, desta vez para um negócio de serviços local em vez de um produto de software. Repare em como as descrições contêm os factos de que um assistente de IA precisaria para responder diretamente à pergunta de um cliente.
# Harbor Dental Clinic
> Harbor Dental is a family dental practice in Portland, Oregon,
> offering general, cosmetic, and emergency dentistry since 2004.
## Services
- [General Dentistry](https://harbordental.example/general.md):
Cleanings, fillings, crowns, and preventive care.
- [Emergency Care](https://harbordental.example/emergency.md):
Same-day appointments for pain, breaks, and lost fillings.
- [Cosmetic Dentistry](https://harbordental.example/cosmetic.md):
Whitening, veneers, and Invisalign.
## Visit
- [Hours & Location](https://harbordental.example/contact.md): Open
Mon-Fri 8am-5pm at 120 Harbor St, Portland OR 97201.
- [New Patients](https://harbordental.example/new-patients.md):
Insurance accepted, intake forms, and what to expect.
## Optional
- [Patient Reviews](https://harbordental.example/reviews.md)
- [Blog](https://harbordental.example/blog.md)
Um terceiro, reduzido ao mínimo absoluto que ainda é válido — um H1 e uma secção. Isto é legítimo; não precisa de todas as secções para ter um ficheiro utilizável.
# Jane Doe — Freelance Illustrator
> Editorial and children's book illustrator based in Berlin,
> available for commissions.
## Links
- [Portfolio](https://janedoe.example/work.md): Selected published work.
- [Rates & Contact](https://janedoe.example/contact.md): Commission
pricing and how to get in touch.
Onde Alojá-lo
Aloje o ficheiro na raiz do seu domínio: https://oseudominio.com/llms.txt. Este é o único local que a convenção especifica, exatamente como o robots.txt. Não o coloque num subdiretório e não lhe mude o nome — as ferramentas procuram esse caminho preciso.
Algumas notas práticas de alojamento:
- Sirva-o com o tipo de conteúdo
text/plain(outext/markdown); a maioria dos alojamentos estáticos faz isto automaticamente para um ficheiro.txt. - Certifique-se de que devolve HTTP 200 no URL canónico e de que não está bloqueado por autenticação, geobloqueio ou uma regra de disallow do
robots.txt. - Se gere vários subdomínios (por exemplo
docs.eapp.), cada subdomínio pode ter o seu própriollms.txtrestrito a esse host. - Mantenha-o sob controlo de versões e atualize-o quando os seus URLs importantes mudarem, tal como manteria um sitemap.
Como o llms.txt Difere do robots.txt e do sitemap.xml
Estes três ficheiros vivem todos na raiz do domínio e todos falam para clientes automatizados, o que é exatamente por que se confundem. Resolvem problemas diferentes e são complementares, não substitutos. Mantenha os três.
| Aspeto | llms.txt | robots.txt | sitemap.xml |
|---|---|---|---|
| Público principal | Modelos de IA / assistentes LLM | Bots de pesquisa e de rastreio | Rastreadores de motores de pesquisa |
| Formato | Markdown (legível por humanos + máquinas) | Diretivas de texto simples | XML |
| Finalidade | Curar conteúdo-chave para leitura no momento da inferência | Permitir ou proibir o rastreio de caminhos | Listar todos os URLs indexáveis para descoberta |
| Contém descrições? | Sim, descrições em prosa por link | Não | Não (apenas URLs + metadados) |
| Seletividade | Altamente curado, apenas o que mais importa | Regras para todo o site | Abrangente, idealmente todas as páginas |
| Padrão oficial? | Convenção proposta, não ratificada | Padrão de facto (RFC 9309) | Padrão reconhecido (sitemaps.org) |
| Imposto pelos fornecedores? | Sem garantia de que algum fornecedor o leia | Amplamente respeitado | Amplamente respeitado |
O modelo mental: o sitemap.xml diz "aqui está tudo o que existe", o robots.txt diz "aqui está o que pode e não pode aceder", e o llms.txt diz "aqui está o que realmente importa e o que significa". Um sitemap é exaustivo e sem descrições; um llms.txt é seletivo e anotado.
Um esclarecimento importante sobre o controlo de rastreio. O llms.txt não bloqueia ninguém de nada — não concede permissões nem revoga nenhumas. Se quiser controlar se as empresas de IA rastreiam o seu site para treino, isso faz-se através das regras de user-agent do robots.txt (para bots como GPTBot, ClaudeBot, Google-Extended) e, cada vez mais, de uma camada de permissões separada proposta ao estilo ai.txt. Não trate o llms.txt como um ficheiro de consentimento ou de exclusão.
Como os Rastreadores e Assistentes de IA o Usam Realmente
Aqui é onde a honestidade é essencial, porque a distância entre o que é tecnicamente possível e o que está confirmado em produção é grande.
O que acontece hoje. Um conjunto crescente de ferramentas orientadas para programadores lê o llms.txt. Plataformas de documentação, vários assistentes de programação com IA e integrações de IDE, e alguns frameworks de recuperação vão buscar /llms.txt quando os apontamos para um domínio, e depois usam-no para decidir que páginas trazer para o contexto. Se alguma vez colou um URL de documentação numa ferramenta de programação com IA e a viu encontrar rapidamente as páginas de referência certas, um llms.txt pode ser o motivo.
O que não está confirmado. À data desta escrita, os grandes produtos de pesquisa com IA para consumidores não se comprometeram publicamente a usar o llms.txt como sinal de classificação ou de recuperação nas suas respostas web gerais. As declarações públicas de pessoas de alguns grandes fornecedores têm sido céticas, notando que já extraem conteúdo do HTML em escala. Por isso, não deve esperar que publicar um llms.txt o faça, por si só, ser citado mais vezes nas respostas de um assistente de IA de uso geral.
Por que ainda pode valer a pena fazê-lo. O custo é quase nulo — é um pequeno ficheiro Markdown — e a prática força um exercício útil: decidir quais dos dez ou vinte URLs do seu site representam realmente o seu valor, e escrever uma descrição de uma linha para cada. Essa clareza ajuda o seu HTML, os seus metadados e a sua estratégia de conteúdo, independentemente de quem leia o ficheiro. E se a adoção crescer, já estará posicionado. Esta é a mesma lógica de baixo custo e alta opcionalidade por detrás da mais ampla otimização de motores generativos: otimiza para a forma como os sistemas de IA consomem conteúdo porque é para aí que a descoberta se dirige.
Para conteúdo que os sistemas de IA analisam neste momento com efeito confirmado, os dados estruturados fazem mais trabalho pesado do que o llms.txt. Veja a nossa análise sobre a marcação schema que os motores de pesquisa com IA realmente leem — combinar schema válido com um llms.txt limpo cobre tanto os canais confirmados como os emergentes.
Adoção e Limitações Atuais
Para manter as expetativas calibradas, eis o estado da situação em termos claros.
- É uma proposta, não um mandato. Não há organismo regulador, teste de conformidade nem penalidade por não ter um. A especificação vive num repositório público e evolui.
- Lê-lo é opcional para os consumidores. Qualquer ferramenta ou modelo que o leia fá-lo por escolha. Muitos não o fazem.
- Não é um sinal de classificação. Nenhum fornecedor de pesquisa ou de IA confirmou que influencia a visibilidade. Trate qualquer afirmação em contrário como marketing, não como facto.
- Pode desatualizar-se. Tal como um sitemap, um
llms.txtque aponta para URLs mortos ou desatualizados é pior do que nenhum. Precisa de manutenção. - Não substitui bom conteúdo nem dados estruturados. É um ficheiro de apontamento. Se as páginas para que aponta são finas, o apontador não ajuda.
Nada disto faz do llms.txt uma má ideia. Faz dele uma prática de higiene de baixo risco e virada para o futuro — mais próxima de adicionar um sitemap em 2006 do que de uma alavanca de crescimento garantida. Publique-o, mantenha-o exato e deixe o ecossistema apanhá-lo.
Perguntas Frequentes
O llms.txt é um padrão oficial da web?
Não. É uma convenção proposta, introduzida em setembro de 2024 e mantida numa especificação pública, mas não foi ratificada por nenhum organismo de normalização como o W3C ou o IETF. Ao contrário do robots.txt, que está formalizado como RFC 9309, o llms.txt não tem estatuto oficial e nenhum fornecedor é obrigado a suportá-lo.
Adicionar o llms.txt vai melhorar as minhas posições no Google ou na pesquisa com IA?
Não há evidência de que melhore, e nenhum grande fornecedor o confirmou como sinal de classificação ou de recuperação para respostas web gerais. Deve adicioná-lo pelo seu baixo custo e potencial futuro, não como tática de SEO. Os ganhos reais de visibilidade continuam a vir de conteúdo de qualidade, dados estruturados e saúde técnica.
Ainda preciso de robots.txt e sitemap.xml se tiver llms.txt?
Sim, absolutamente. Os três ficheiros servem propósitos diferentes e complementares: o sitemap.xml lista todos os seus URLs para descoberta, o robots.txt controla o acesso e as permissões dos rastreadores, e o llms.txt cura e descreve o seu conteúdo-chave para leitura por IA. O llms.txt não concede permissões, por isso nunca pode substituir o robots.txt.
Onde exatamente deve viver o ficheiro llms.txt?
Na raiz do seu domínio, servido em https://oseudominio.com/llms.txt, devolvendo HTTP 200 com um tipo de conteúdo de texto simples ou Markdown. Não pode estar num subdiretório nem atrás de autenticação. Se tiver vários subdomínios, cada um pode alojar o seu próprio ficheiro restrito a esse host.
Que comprimento deve ter um ficheiro llms.txt?
Mantenha-o curto e curado — tipicamente os seus dez a trinta URLs mais importantes, cada um com uma descrição de uma linha. O objetivo é a seletividade, por isso resista a listar todas as páginas. Se quiser fornecer texto completo em vez de links, use um ficheiro llms-full.txt separado para que o llms.txt principal se mantenha um índice enxuto.
Não tem de escrever e manter tudo isto sozinho. Ferramentas como a emax.studio podem gerar o conteúdo otimizado para IA para o qual o seu llms.txt deve apontar — páginas limpas, resumos estruturados e texto que começa pela resposta — para que o ficheiro ligue a material que vale realmente a pena citar.
Crie a sua primeira campanha de marketing com IA em emax.studio — plano gratuito disponível.
Pronto para criar seus próprios reels de vídeo com IA?
5 créditos grátis. Sem cartão de crédito.
Comece grátis