El índice en Markdown con el que le explicas tu web a ChatGPT, Gemini y Perplexity

Cada vez más gente le pregunta a ChatGPT, Gemini, Claude o Perplexity antes de abrir Google. Y cuando esa pregunta va sobre tu sector, alguien va a contestar por ti: un modelo que ha entrado en tu web, ha intentado entenderla entre menús, banners y avisos de cookies, y ha construido una respuesta con lo que ha podido sacar. Si lo encontró ordenado, acierta. Si no, improvisa.
Ahí es donde entra el archivo llms.txt. Y empiezo aclarando lo que más se confunde, porque circula mucha información equivocada al respecto —esta misma página la tuvo—: no es un candado contra la IA. Es justo lo contrario, un índice en Markdown que le pones delante a un modelo para que entienda tu web a la primera y la cite bien.
¿Cómo leen tu web los modelos de IA?
Los modelos de IA leen tu web de dos formas distintas y conviene no mezclarlas: durante el entrenamiento, con rastreadores que aspiran la web pública para aprender de ella; y en el momento de responder, con agentes que entran a buscar información concreta sobre una consulta. El llms.txt actúa sobre lo segundo, no sobre lo primero.
El debate sobre el entrenamiento —si es legítimo que tu blog, tus artículos y tus fichas de producto acabaran dentro de un modelo sin que nadie te preguntara— es real y tiene implicaciones de copyright que no pienso minimizar. Pero es un problema distinto, y el llms.txt no lo resuelve ni lo pretende. Lo que sí puedes controlar hoy, y es donde está el negocio, es la segunda parte: qué encuentra un modelo cuando alguien le pregunta por lo que tú vendes. De eso va este artículo, y de eso va mi servicio de inteligencia artificial aplicada al SEO.
¿Qué es exactamente el archivo llms.txt y cómo funciona?
El archivo llms.txt es un fichero en Markdown que colocas en la raíz de tu dominio y que funciona como el índice que le entregas a un modelo de lenguaje: quién eres, a qué te dedicas y qué página explica cada cosa. Lo propuso Jeremy Howard en septiembre de 2024 y su especificación va ya por la segunda versión.
El motivo de que exista es prosaico: una página web moderna es HTML con menús, banners, scripts y avisos de cookies, y un modelo que intenta entenderla gasta la mitad de su ventana de contexto apartando basura antes de llegar a lo que le interesa. El llms.txt le ahorra ese paso dándole la versión limpia y jerarquizada.
La estructura la fija la especificación y es deliberadamente simple, porque tiene que poder leerla tanto una persona como un programa sin librerías raras. Estas son sus piezas:
- Un H1 con el nombre del sitio o del proyecto. Es la única sección estrictamente obligatoria.
- Una cita (
>) con el resumen. Dos o tres líneas con lo esencial para entender de qué va el sitio y para quién es. - Texto libre con el contexto que haga falta. Párrafos o listas, sin encabezados, para matizar lo que el resumen deja corto.
- Secciones con H2 y listas de enlaces. Cada entrada es un enlace markdown
[nombre](url)y, si quieres, dos puntos y una nota explicando qué encontrará ahí el modelo. - Una sección final
Optional. Todo lo secundario va aquí: es lo primero que un modelo descarta cuando va justo de contexto.
Fíjate en lo que no hay en esa estructura: ni Disallow, ni permisos de entrenamiento, ni licencias. Es un malentendido muy extendido, y conviene dejarlo claro porque yo mismo lo conté mal en la primera versión de este artículo: llms.txt no bloquea nada. Si lo que quieres es impedir que un rastreador de IA entre en tu web, la herramienta sigue siendo robots.txt, indicando el agente concreto (GPTBot, Google-Extended, ClaudeBot y compañía). Son archivos complementarios y resuelven problemas opuestos: uno cierra la puerta, el otro pone un cartel en la entrada explicando dónde está cada cosa.
¿Es llms.txt un estándar oficial ya?
A día de hoy llms.txt no es un estándar oficial: ningún organismo lo ha ratificado y ningún buscador se ha comprometido públicamente a leerlo. Pero ha dejado de ser una idea de foro. La especificación va por su segunda versión, publicada en agosto de 2026 tras dos años de rodaje, y hay miles de sitios que ya la sirven. Plataformas de documentación como Mintlify, GitBook o Wix lo generan de serie, y los propios laboratorios de IA —OpenAI, Anthropic, Google— publican el suyo para su documentación de desarrollo.
El camino se parece al que siguió robots.txt en los noventa: nació como un acuerdo entre caballeros y acabó siendo el estándar de facto. La diferencia es que aquí no hay nada que perder: un llms.txt mal hecho no te penaliza, simplemente no sirve de nada. Este tipo de decisiones son parte del SEO técnico avanzado actual: indexación, crawleo y los nuevos horizontes que tu web necesita explorar.
¿Por qué debería importarte el archivo llms.txt?
Te debería importar el llms.txt porque cada vez más gente pregunta a un chatbot antes de abrir Google, y la respuesta que reciben sobre tu negocio la construye un modelo con lo que encuentra en tu web. Si lo encuentra ordenado, acierta. Si no, improvisa. Tres motivos concretos:
Le ahorras trabajo al modelo y ganas precisión
Una web normal le llega a un modelo con el menú, el pie, el banner de cookies y tres avisos de por medio. El llms.txt le entrega en su lugar un índice limpio en markdown, sin ruido y sin gastar contexto. Es la diferencia entre que te entienda a la primera o que se invente la mitad.
Control sobre lo que la IA cuenta de tu marca
Un modelo que no encuentra tu información ordenada no se queda callado: la rellena con lo que puede, y ahí es donde aparecen los precios que no cobras, los servicios que no prestas y las zonas donde no trabajas. El llms.txt es la forma más barata de fijar tú el relato: qué eres, qué haces y qué página explica cada cosa.
Ser la fuente que la IA cita
Si mañana las respuestas de IA pasan a citar y enlazar fuentes de forma sistemática —y va en esa dirección—, el sitio que tenga su contenido bien declarado parte con ventaja. No hablo de licenciar contenido a OpenAI: hablo de algo mucho más inmediato, que es aparecer como fuente cuando un cliente potencial pregunta por lo que tú vendes.
Resumiendo: llms.txt no es un candado, es un escaparate. No impide que nadie use tu contenido; lo que hace es asegurarse de que, cuando un modelo hable de tu sector, tenga delante tu versión ordenada y no una reconstrucción a trozos. Implementarlo cuesta una tarde y se comprueba en un minuto con el validador de llms.txt. Si quieres que lo montemos bien, con la estructura de contenidos detrás que lo hace útil, eso es exactamente lo que hago en mi servicio de inteligencia artificial aplicada al SEO.
Acción inmediata para liderar el mercado
La ventana de oportunidad para posicionarse en las respuestas generativas es ahora. Si buscas un partner que domine el lenguaje de los algoritmos y comprenda las necesidades financieras de una empresa real, podemos trabajar juntos para que dejes de ser un enlace azul y te conviertas en la autoridad que el mercado actual va a elegir.

