llms.txt explicado: qué es, quién lo lee y cómo escribir uno
llms.txt es un archivo Markdown que enumera las páginas clave de un sitio para agentes de IA. El formato, quién lo usa realmente y cómo escribir uno.
Respuesta directa
llms.txt es un archivo Markdown propuesto, alojado en la raíz de un sitio, que enumera las páginas que un agente de IA debería leer primero. Toma la idea de robots.txt: un archivo de texto plano con una forma fija que cualquier rastreador puede encontrar en una URL predecible. La versión corta de "quién lo lee": a día de hoy, ningún proveedor importante de LLM se ha comprometido a leerlo. Trátalo como una pequeña pieza de optimización para motores de respuesta, no como una palanca de posicionamiento.
Qué es y por qué importa
El HTML está hecho para personas. Una página típica envuelve su contenido en navegación, anuncios y JavaScript, y extraer texto limpio de ahí es lento e impreciso para un modelo de lenguaje que recorre muchas páginas dentro de una ventana de contexto. La especificación de llms.txt existe para darle a un agente un atajo: un índice curado, legible tanto por personas como por máquinas, del contenido más importante de un sitio, en un formato que los modelos de lenguaje ya interpretan bien, Markdown.
Jeremy Howard, de Answer.AI, escribió la especificación, publicada el 3 de septiembre de 2024, y todavía sigue evolucionando. La versión v2 actual se revisó por última vez el 10 de agosto de 2026. La estructura requerida se mantiene deliberadamente pequeña: un H1 con el nombre del sitio o proyecto, el único elemento obligatorio, una cita en bloque con un resumen de una línea, secciones de texto opcionales para dar contexto, y luego una o más secciones H2 que contienen cada una una lista de enlaces.
Ese minimalismo es la clave. No es un mapa del sitio completo ni pretende sustituirlo. Un sitemap enumera cada URL para que un rastreador la indexe; llms.txt enumera un conjunto mucho más pequeño y seleccionado a mano para que un agente lo lea y lo razone de verdad. Piénsalo como un índice que un agente puede repasar de un vistazo y luego decidir qué buscar a continuación, en lugar de un catálogo completo de todo lo que publica un sitio.
El nombre también resulta un poco engañoso. Suena a archivo de reglas, algo con la forma de robots.txt que bloquea o permite el acceso. No lo es. Nada en la especificación otorga ni niega permisos. Un agente que ignore llms.txt por completo y rastree el HTML renderizado en su lugar no ha violado nada, porque no existe mecanismo de cumplimiento ni organismo regulador detrás del formato todavía, solo una especificación pública y una comunidad que ha convergido en torno a ella.
Kallos Labs trata llms.txt como un elemento más dentro de una auditoría técnica de SEO más amplia, junto con la cobertura del sitemap, el schema y la velocidad de página, en lugar de como un proyecto independiente. El archivo rara vez cambia el resultado de esa auditoría por sí solo, pero cuesta tan poco que omitirlo no aporta ninguna ventaja.
Cómo funciona en la práctica
Escribir un archivo llms.txt significa seguir el formato al pie de la letra, porque los agentes que analizan muchos sitios se benefician más de la consistencia que de la creatividad. Un archivo mínimo empieza con un H1 con el nombre del proyecto y un resumen de una línea en cita en bloque, y luego organiza los enlaces en secciones H2 así:
## Docs
- [Getting Started](https://example.com/docs/start): Setup and first steps
- [API Reference](https://example.com/docs/api): Full endpoint list
Cada entrada en una sección de enlaces es un enlace Markdown estándar, seguido opcionalmente de dos puntos y una breve descripción.
Sirve el archivo como text/plain; charset=utf-8, según la guía de implementación de Vercel, para que un agente pueda leer el Markdown en bruto sin depender de la detección del tipo de contenido. En un sitio Next.js, eso es un route handler en /llms.txt que devuelve la cadena con esa cabecera establecida explícitamente, el mismo patrón que se usa para cualquier otro endpoint legible por máquinas, un feed RSS o un sitemap JSON incluidos.
Unas pocas reglas prácticas mantienen el archivo útil en vez de decorativo. Enlaza a páginas canónicas en lugar de pegar su contenido dentro. El archivo es un índice, no un espejo, y una copia desactualizada dentro de llms.txt es peor que no tener copia una vez que la página de origen cambia. Mantén la descripción tras cada enlace corta y factual: una sola frase suele bastar, ya que el objetivo es ayudar a un agente a decidir qué buscar, no venderle la página. Y agrupa los enlaces bajo encabezados H2 con significado, Docs, Pricing, Changelog, en lugar de una lista plana, porque el encabezado es la única señal que recibe un agente antes de decidir si una sección es relevante.
Pueden coexistir dos archivos: /llms.txt como índice ligero que enlaza a páginas canónicas, y /llms-full.txt como un único archivo que contiene el texto completo de todo lo referenciado. Esa combinación se justifica cuando un conjunto de documentación crece lo suficiente como para que enlazar por sí solo ya no aporte suficiente contexto. El archivo también puede vivir en una subruta, como /docs/llms.txt, limitado a las URL bajo esa ruta. Cuando existe más de un archivo aplicable, gana el más específico, de modo que un subdominio de documentación puede mantener su propio archivo sin entrar en conflicto con el de la raíz.
Compensaciones y casos límite
Este es el estado real de la adopción. Una investigación que analizó 137.000 dominios encontró que el 28 por ciento, unos 38.360 sitios, publica un archivo llms.txt válido. Pero el 97 por ciento de esos archivos registró cero solicitudes en mayo de 2026, según el análisis de Ahrefs. Publicar uno no es lo mismo que ser leído.
Hay una señal real detrás de esa cifra, aunque no sea un compromiso de rastreo. Google mencionó llms.txt dentro de su protocolo Agent2Agent en abril de 2025, y en mayo de 2026 publicó una guía de optimización para IA junto con auditorías experimentales de Lighthouse que cubren un terreno similar. OpenAI, Anthropic y Meta no han hecho ninguna declaración equivalente.
El precedente más cercano resulta revelador. robots.txt se propuso en febrero de 1994 y se convirtió en un estándar de facto en pocos meses, pero no se estandarizó formalmente hasta el RFC 9309, en septiembre de 2022, veintiocho años después. El cumplimiento con él fue, y sigue siendo, totalmente voluntario; un rastreador que lo ignora no enfrenta ninguna barrera técnica, solo una reputacional. llms.txt se encuentra en un punto más temprano de ese mismo recorrido: informal, sin aplicación forzosa, y adoptado más rápido de lo que se ha demostrado útil.
Eso apunta a una recomendación concreta y modesta. Un archivo llms.txt cuesta poco añadir: una ruta, un archivo Markdown, un puñado de enlaces a las mejores páginas propias de un sitio. Vale la pena incluirlo como parte de un repaso técnico normal, junto al trabajo de sitemap y schema, el tipo de elemento de checklist de AEO que Kallos Labs ejecuta para sus clientes. No vale la pena tratarlo como un canal de crecimiento, un factor de posicionamiento, ni un motivo para posponer las partes del SEO técnico que ya tienen un efecto medible: la velocidad de página, los datos estructurados y la indexación, entre las principales.
El fallo más claro va en la dirección contraria: equipos que dedican tiempo real de ingeniería a construir y mantener un llms.txt elaborado, con regeneración automatizada y un corpus completo reflejado en llms-full.txt, antes de haber arreglado una puntuación lenta de Core Web Vitals o un sitemap que omite la mitad del sitio. El orden importa aquí. Publica el archivo y luego pasa a los elementos de la auditoría con un historial real.
Preguntas frecuentes
¿ChatGPT o Google realmente leen llms.txt?
Ningún proveedor importante de LLM, OpenAI, Anthropic, Google o Meta, se ha comprometido formalmente a obtener o interpretar llms.txt hasta la fecha. Google mencionó el formato dentro de su protocolo Agent2Agent en abril de 2025, pero una mención dentro de una especificación de protocolo no es un compromiso de rastreo.
¿Es llms.txt lo mismo que robots.txt?
No. robots.txt indica a los rastreadores a qué no pueden acceder; llms.txt es un mapa curado de lo que un sitio quiere que un agente lea primero. robots.txt tardó hasta el RFC 9309, en septiembre de 2022, veintiocho años después de su debut en 1994, en convertirse en un estándar formal, y llms.txt sigue siendo una propuesta informal en comparación.
¿Dónde vive llms.txt y qué formato tiene?
Vive en la raíz del sitio, /llms.txt, servido como text/plain; charset=utf-8. El archivo en sí es Markdown: un H1 con el nombre del proyecto, una cita en bloque con el resumen, y secciones H2 que enumeran enlaces como [título](url): descripción.
¿Qué es llms-full.txt?
Un archivo complementario que algunos sitios publican junto a un índice ligero /llms.txt. Mientras que llms.txt enlaza a páginas canónicas, llms-full.txt incluye el texto completo de la documentación referenciada en un solo archivo, algo que conviene más a conjuntos de documentación grandes que una simple lista de enlaces.
¿Debería un sitio publicar un archivo llms.txt de todos modos?
Sí, como una adición de bajo coste, no como un proyecto prioritario. Una investigación que analizó 137.000 dominios encontró que el 97 por ciento de los archivos llms.txt publicados registró cero solicitudes en mayo de 2026, así que es una pequeña apuesta por un estándar futuro más que una palanca con un retorno medible hoy.