EMAX Studio Blog
La guía completa de llms.txt (con ejemplos): formato, alojamiento y cómo lo usan los rastreadores de IA
Manuel Mrosek · 2026-08-21 · — visitas
La guía completa de llms.txt (con ejemplos): formato, alojamiento y cómo lo usan los rastreadores de IA
llms.txt es un archivo Markdown de texto plano que colocas en la raíz de tu dominio (https://yourdomain.com/llms.txt) y que da a los modelos de IA un mapa limpio y curado de tu contenido más importante. Es una convención propuesta —introducida por Jeremy Howard de Answer.AI en septiembre de 2024—, no un estándar web oficial, y ningún gran proveedor de IA garantiza actualmente que lo lea ni que tenerlo mejore tu posicionamiento.
Esa honestidad de entrada importa, porque la mayoría de las guías de llms.txt lo sobrevaloran. Esta te mostrará exactamente cómo escribir el archivo, dónde alojarlo, cómo se relaciona con robots.txt y sitemap.xml, y qué hace y qué no hace de forma realista hoy. Si quieres el panorama estratégico más amplio, lee junto a esta nuestra guía sobre cómo hacer tu sitio web descubrible para la IA.
¿Qué es llms.txt y qué problema resuelve?
Cuando un modelo de lenguaje grande necesita información sobre tu sitio, se enfrenta a dos problemas. Primero, las páginas HTML son ruidosas: menús de navegación, avisos de cookies, anuncios, JavaScript y pies de página entierran el contenido real. Segundo, los modelos trabajan dentro de una ventana de contexto limitada, así que no pueden ingerir todo tu sitio. Convertir HTML desordenado en señal limpia en el momento de la inferencia es costoso y propenso a errores.
llms.txt aborda esto haciendo la curación por el modelo. En lugar de dejar que un rastreador adivine qué páginas importan, le entregas un documento Markdown corto y estructurado que enumera tus recursos clave con descripciones en lenguaje llano. Piénsalo como un índice de contenidos escrito específicamente para máquinas que leen texto, no para navegadores que renderizan píxeles.
Conviene ser preciso sobre el alcance. llms.txt está orientado a la recuperación en el momento de la inferencia: el momento en que un asistente de IA está respondiendo una pregunta y quiere incorporar información relevante y actual sobre tu producto, documentación o políticas. No fue diseñado como mecanismo de control de datos de entrenamiento. Ese trabajo aún corresponde a robots.txt y a las nuevas directivas de rastreadores específicas para IA.
El formato del archivo llms.txt
La especificación define una estructura Markdown simple y legible por humanos. Tiene una parte obligatoria y varias opcionales, y el orden es fijo para que los analizadores puedan confiar en él.
El formato, en orden:
- Un H1 con el nombre del proyecto o del sitio. Esta es la única línea estrictamente obligatoria.
- Una cita en bloque (
>) con un resumen corto. Una o dos frases que describen qué es el sitio o el proyecto. Opcional pero muy recomendable. - Cero o más párrafos de contexto adicional (sin títulos), que dan al modelo el detalle que necesita para interpretar el resto del archivo.
- Secciones H2, cada una con una lista Markdown de enlaces. Cada elemento de la lista es un hiperenlace, seguido opcionalmente de dos puntos y una descripción corta.
- Una sección
## Optional. Los enlaces aquí se marcan explícitamente como omisibles: un modelo con un presupuesto de contexto ajustado puede descartarlos sin perder nada esencial.
La decisión de diseño clave es que todo es Markdown estándar. Eso significa que el mismo archivo es legible por un humano en un editor de texto y trivialmente analizable por un modelo, ya que los LLM ya dominan Markdown.
El patrón complementario: llms-full.txt y páginas .md
Dos convenciones relacionadas suelen aparecer junto a llms.txt:
llms-full.txt: un único archivo, más grande, que contiene el texto completo real, no solo enlaces. Útil cuando quieres que un modelo tenga todo en una sola descarga, a costa de un archivo mucho mayor.- Versiones
.mdlimpias de las páginas: la práctica de servir una copia en Markdown de cualquier página HTML en la misma URL con.mdañadido (por ejemploabout.html.md). Los enlaces de tullms.txtpueden apuntar a estas versiones limpias para que un modelo nunca tenga que analizar HTML.
Archivos de ejemplo trabajados
Aquí tienes un llms.txt mínimo para un pequeño producto SaaS. Esta es la base que todo el mundo debería ser capaz de producir.
# Acme Analytics
> Acme Analytics is a privacy-first web analytics tool for small
> teams. It is cookieless, GDPR-compliant, and self-hostable.
Acme replaces heavyweight analytics suites with a single lightweight
script. Pricing is flat-rate per site with no event caps.
## Docs
- [Quick Start](https://acme.example/docs/quickstart.md): Install the
script and see your first data in under five minutes.
- [API Reference](https://acme.example/docs/api.md): Full REST API for
querying metrics programmatically.
- [Self-Hosting Guide](https://acme.example/docs/self-host.md): Run
Acme on your own infrastructure with Docker.
## Product
- [Features](https://acme.example/features.md): What Acme measures and
how it protects visitor privacy.
- [Pricing](https://acme.example/pricing.md): Flat monthly pricing per
tracked site.
## Optional
- [Changelog](https://acme.example/changelog.md): Release history.
- [Company](https://acme.example/about.md): Team and founding story.
Un segundo ejemplo, esta vez para un negocio de servicios local en lugar de un producto de software. Fíjate en cómo las descripciones llevan los hechos que un asistente de IA necesitaría para responder directamente a la pregunta de un cliente.
# Harbor Dental Clinic
> Harbor Dental is a family dental practice in Portland, Oregon,
> offering general, cosmetic, and emergency dentistry since 2004.
## Services
- [General Dentistry](https://harbordental.example/general.md):
Cleanings, fillings, crowns, and preventive care.
- [Emergency Care](https://harbordental.example/emergency.md):
Same-day appointments for pain, breaks, and lost fillings.
- [Cosmetic Dentistry](https://harbordental.example/cosmetic.md):
Whitening, veneers, and Invisalign.
## Visit
- [Hours & Location](https://harbordental.example/contact.md): Open
Mon-Fri 8am-5pm at 120 Harbor St, Portland OR 97201.
- [New Patients](https://harbordental.example/new-patients.md):
Insurance accepted, intake forms, and what to expect.
## Optional
- [Patient Reviews](https://harbordental.example/reviews.md)
- [Blog](https://harbordental.example/blog.md)
Un tercero, reducido al mínimo absoluto que sigue siendo válido: un H1 y una sección. Esto es legítimo; no necesitas cada sección para tener un archivo utilizable.
# Jane Doe — Freelance Illustrator
> Editorial and children's book illustrator based in Berlin,
> available for commissions.
## Links
- [Portfolio](https://janedoe.example/work.md): Selected published work.
- [Rates & Contact](https://janedoe.example/contact.md): Commission
pricing and how to get in touch.
Dónde alojarlo
Aloja el archivo en la raíz de tu dominio: https://yourdomain.com/llms.txt. Esta es la única ubicación que especifica la convención, exactamente igual que robots.txt. No lo pongas en un subdirectorio y no lo renombres: las herramientas buscan esa ruta precisa.
Unas cuantas notas prácticas de alojamiento:
- Sírvelo con el tipo de contenido
text/plain(otext/markdown); la mayoría de los hosts estáticos lo hacen automáticamente para un archivo.txt. - Asegúrate de que devuelve HTTP 200 en la URL canónica y de que no está bloqueado por autenticación, geobloqueo o una regla de exclusión de
robots.txt. - Si ejecutas varios subdominios (por ejemplo
docs.yapp.), cada subdominio puede tener su propiollms.txtacotado a ese host. - Mantenlo bajo control de versiones y actualízalo cuando cambien tus URLs importantes, igual que mantendrías un sitemap.
En qué se diferencia llms.txt de robots.txt y sitemap.xml
Estos tres archivos viven en la raíz del dominio y todos hablan a clientes automatizados, que es exactamente por lo que se confunden. Resuelven problemas distintos y son complementarios, no sustitutos. Conserva los tres.
| Aspecto | llms.txt | robots.txt | sitemap.xml |
|---|---|---|---|
| Audiencia principal | Modelos de IA / asistentes LLM | Bots de búsqueda y rastreo | Rastreadores de motores de búsqueda |
| Formato | Markdown (legible por humano y máquina) | Directivas de texto plano | XML |
| Propósito | Curar contenido clave para lectura en inferencia | Permitir o denegar el rastreo de rutas | Enumerar todas las URLs indexables para descubrimiento |
| ¿Contiene descripciones? | Sí, descripciones en prosa por enlace | No | No (solo URLs + metadatos) |
| Selectividad | Muy curado, solo lo que más importa | Reglas sobre todo el sitio | Exhaustivo, idealmente cada página |
| ¿Estándar oficial? | Convención propuesta, no ratificada | Estándar de facto (RFC 9309) | Estándar reconocido (sitemaps.org) |
| ¿Aplicado por proveedores? | Sin garantía de que ningún proveedor lo lea | Ampliamente respetado | Ampliamente respetado |
El modelo mental: sitemap.xml dice "aquí está todo lo que existe", robots.txt dice "aquí está lo que puedes y no puedes acceder", y llms.txt dice "aquí está lo que realmente importa y qué significa". Un sitemap es exhaustivo y sin descripciones; un llms.txt es selectivo y anotado.
Una aclaración importante sobre el control de rastreo. llms.txt no bloquea a nadie de nada: no concede permisos ni revoca ninguno. Si quieres controlar si las empresas de IA rastrean tu sitio para entrenamiento, eso se hace mediante reglas de user-agent en robots.txt (para bots como GPTBot, ClaudeBot, Google-Extended) y, cada vez más, una capa de permisos separada al estilo de ai.txt propuesta. No trates llms.txt como un archivo de consentimiento o exclusión.
Cómo usan realmente los rastreadores y asistentes de IA este archivo
Aquí es donde la honestidad es esencial, porque la brecha entre lo que es técnicamente posible y lo que está confirmado en producción es amplia.
Qué ocurre hoy. Un conjunto creciente de herramientas orientadas a desarrolladores lee llms.txt. Las plataformas de documentación, varios asistentes de código de IA e integraciones de IDE, y algunos marcos de recuperación buscarán /llms.txt cuando los apuntes a un dominio, y luego lo usan para decidir qué páginas incorporar al contexto. Si alguna vez has pegado una URL de documentación en una herramienta de código de IA y la has visto encontrar rápido las páginas de referencia correctas, puede que un llms.txt sea la razón.
Qué no está confirmado. A fecha de hoy, los grandes productos de búsqueda con IA para consumidores no se han comprometido públicamente a usar llms.txt como señal de posicionamiento o recuperación en sus respuestas web generales. Las declaraciones públicas de personas de algunos grandes proveedores han sido escépticas, señalando que ya extraen contenido de HTML a escala. Así que no deberías esperar que publicar un llms.txt vaya a hacer, por sí solo, que te citen más a menudo en las respuestas de un asistente de IA de propósito general.
Por qué aún puede valer la pena hacerlo. El coste es casi nulo —es un pequeño archivo Markdown— y la práctica fuerza un ejercicio útil: decidir cuáles de las diez o veinte URLs de tu sitio representan realmente tu valor, y escribir una descripción de una línea de cada una. Esa claridad ayuda a tu HTML, tus metadatos y tu estrategia de contenido independientemente de quién lea el archivo. Y si la adopción crece, ya estás posicionado. Esta es la misma lógica de bajo coste y alta opcionalidad detrás de la optimización para motores generativos más amplia: optimizas para cómo los sistemas de IA consumen contenido porque ahí es hacia donde se dirige el descubrimiento.
Para el contenido que los sistemas de IA analizan ahora mismo con efecto confirmado, los datos estructurados hacen más trabajo pesado que llms.txt. Consulta nuestro desglose sobre el marcado de esquema que los motores de búsqueda con IA leen realmente: combinar un esquema válido con un llms.txt limpio cubre tanto el canal confirmado como el emergente.
Adopción actual y limitaciones
Para mantener las expectativas calibradas, aquí tienes el estado de la cuestión en términos claros.
- Es una propuesta, no un mandato. No hay órgano de gobierno, ni prueba de conformidad, ni penalización por no tener uno. La especificación vive en un repositorio público y evoluciona.
- Leerlo es opcional para los consumidores. Cualquier herramienta o modelo que lo lea lo hace por elección. Muchos no lo hacen.
- No es una señal de posicionamiento. Ningún proveedor de búsqueda o IA ha confirmado que influya en la visibilidad. Trata cualquier afirmación en contra como marketing, no como hecho.
- Puede quedar desfasado. Como un sitemap, un
llms.txtque apunta a URLs muertas o desactualizadas es peor que ninguno. Necesita mantenimiento. - No sustituye al buen contenido ni a los datos estructurados. Es un archivo de punteros. Si las páginas a las que apunta son escasas, el puntero no ayuda.
Nada de esto convierte a llms.txt en una mala idea. Lo convierte en una práctica de higiene de bajo riesgo y con visión de futuro, más cercana a añadir un sitemap en 2006 que a una palanca de crecimiento garantizada. Publícalo, mantenlo preciso y deja que el ecosistema se ponga al día.
Preguntas frecuentes
¿Es llms.txt un estándar web oficial?
No. Es una convención propuesta introducida en septiembre de 2024 y mantenida en una especificación pública, pero no ha sido ratificada por ningún organismo de estándares como el W3C o el IETF. A diferencia de robots.txt, que está formalizado como RFC 9309, llms.txt no tiene estatus oficial y ningún proveedor está obligado a admitirlo.
¿Añadir llms.txt mejorará mi posicionamiento en Google o en la búsqueda con IA?
No hay evidencia de que lo haga, y ningún gran proveedor lo ha confirmado como señal de posicionamiento o recuperación para las respuestas web generales. Deberías añadirlo por su bajo coste y su potencial futuro, no como táctica de SEO. Las verdaderas ganancias de visibilidad aún provienen de contenido de calidad, datos estructurados y salud técnica.
¿Sigo necesitando robots.txt y sitemap.xml si tengo llms.txt?
Sí, absolutamente. Los tres archivos sirven a propósitos distintos y complementarios: sitemap.xml enumera todas tus URLs para el descubrimiento, robots.txt controla el acceso y los permisos de los rastreadores, y llms.txt cura y describe tu contenido clave para la lectura por IA. llms.txt no concede permisos, así que nunca puede sustituir a robots.txt.
¿Dónde debería vivir exactamente el archivo llms.txt?
En la raíz de tu dominio, servido en https://yourdomain.com/llms.txt, devolviendo HTTP 200 con un tipo de contenido de texto plano o Markdown. No debe estar en un subdirectorio ni detrás de autenticación. Si tienes varios subdominios, cada uno puede alojar su propio archivo acotado a ese host.
¿Cuál debería ser la longitud de un archivo llms.txt?
Mantenlo corto y curado: normalmente tus diez a treinta URLs más importantes, cada una con una descripción de una línea. El objetivo mismo es la selectividad, así que resiste la tentación de enumerar cada página. Si quieres proporcionar el texto completo en lugar de enlaces, usa un archivo llms-full.txt separado para que el llms.txt principal siga siendo un índice ligero.
No tienes que escribir y mantener todo esto a mano tú solo. Herramientas como emax.studio pueden generar el contenido optimizado para IA al que debería apuntar tu llms.txt —páginas limpias, resúmenes estructurados y copia que empieza por la respuesta— para que el archivo enlace a material que realmente vale la pena citar.
Crea tu primera campaña de marketing impulsada por IA en emax.studio — plan gratuito disponible.
¿Listo para crear tus propios reels de video con IA?
5 créditos gratis. Sin tarjeta de crédito.
Empieza gratis