llms.txt es una convención propuesta para que los sitios web publiquen un archivo de texto plano o Markdown en la ruta /llms.txt, que enumera enlaces y resúmenes seleccionados con el objetivo de ayudar a los sistemas de IA y modelos de lenguaje grandes a encontrar y comprender el contenido de un sitio de manera más eficiente que rastreando y analizando su HTML completo. Fue propuesta en septiembre de 2024 por Jeremy Howard, cofundador de fast.ai, modelada explícitamente según las convenciones ya establecidas de robots.txt y sitemap.xml, que ya brindan a los rastreadores automatizados una guía estructurada sobre un sitio.
La propuesta respondió a un problema práctico: las páginas web modernas suelen estar cargadas de navegación, renderizado de JavaScript, publicidad y marcado de diseño que las hacen costosas o poco fiables para que un modelo de lenguaje las procese dentro de un contexto limitado, mientras que un resumen seleccionado en Markdown con enlaces directos a páginas clave podría consumirse de manera económica y fiable.
Formato y adopción
Un archivo llms.txt típico comienza con un título H1 y un breve resumen del sitio, seguido de listas de enlaces con formato Markdown agrupadas bajo encabezados, que a menudo apuntan a un archivo llms-full.txt correspondiente con el contenido completo de la página renderizado en Markdown. La adopción se extendió primero entre empresas de herramientas para desarrolladores y sitios de documentación, donde el contenido técnico limpio y rastreable ya era una prioridad, antes de ampliarse a plataformas de consumo y contenido más amplias durante 2025 y 2026. A diferencia de robots.txt, que se aplica por convención en prácticamente todos los rastreadores principales, llms.txt no tiene un soporte universal equivalente; a mediados de la década de 2020, ningún laboratorio importante de IA había confirmado que sus modelos o rastreadores obtuvieran y usaran el archivo de manera sistemática, lo que llevó a algunos comentaristas a describir la adopción como en gran medida especulativa o simbólica.
Relación con GEO y críticas
La propuesta se discute con frecuencia junto con optimización para motores generativos, la práctica de hacer que el contenido sea más probable de ser citado por los motores de respuesta de IA, ya que un llms.txt bien mantenido es una posible palanca para GEO, aunque su efecto real en las tasas de citación no esté verificado. Los críticos han argumentado que, en ausencia de un consumo confirmado por parte de los principales sistemas de IA, llms.txt funciona más como una declaración de intenciones o una cobertura que como una técnica de optimización probada, y que los agentes de IA recurren cada vez más a la navegación de páginas completas y al uso de herramientas en lugar de depender de un resumen estático seleccionado. Los partidarios responden que incluso una adopción parcial reduce la fricción para los agentes y los pipelines de generación aumentada por recuperación que sí lo respetan, y que la convención cuesta poco publicarla independientemente de una adopción incierta.