llms.txt est une convention proposée permettant aux sites web de publier un fichier en texte brut ou en Markdown à l'adresse /llms.txt, listant des liens et des résumés sélectionnés destinés à aider les systèmes d'IA et les grands modèles de langage à trouver et comprendre le contenu d'un site plus efficacement qu'en explorant et analysant l'intégralité de son HTML. Cette proposition a été faite en septembre 2024 par Jeremy Howard, cofondateur de fast.ai, explicitement inspirée des conventions bien établies robots.txt et sitemap.xml qui fournissent déjà des directives structurées aux robots d'exploration automatisés.
La proposition répondait à un problème pratique : les pages web modernes sont souvent chargées de navigation, de rendu JavaScript, de publicité et de balisage de mise en page qui les rendent coûteuses ou peu fiables à traiter pour un modèle de langage dans un contexte limité, alors qu'un résumé Markdown sélectionné avec des liens directs vers les pages clés pourrait être consommé à moindre coût et de manière fiable.
Format et adoption
Un fichier llms.txt typique commence par un titre H1 et un court résumé du site, suivi de listes de liens formatées en Markdown regroupées sous des titres, pointant souvent vers un fichier llms-full.txt correspondant contenant le contenu complet des pages rendu en Markdown. L'adoption s'est d'abord répandue parmi les entreprises d'outils pour développeurs et les sites de documentation, où un contenu technique propre et explorable était déjà une priorité, avant de s'étendre à des plateformes grand public et de contenu plus larges au cours de 2025 et 2026. Contrairement à robots.txt, qui est appliqué par convention par pratiquement tous les principaux robots d'exploration, llms.txt ne bénéficie d'aucun support universel équivalent ; au milieu des années 2020, aucun grand laboratoire d'IA n'avait confirmé que ses modèles ou robots d'exploration récupèrent et utilisent systématiquement le fichier, ce qui a conduit certains commentateurs à décrire l'adoption comme largement spéculative ou symbolique.
Relation avec le GEO et critiques
La proposition est fréquemment discutée en lien avec le optimisation pour les moteurs génératifs, la pratique consistant à rendre le contenu plus susceptible d'être cité par les moteurs de réponse IA, car un llms.txt bien maintenu est un levier potentiel pour le GEO, même si son effet réel sur les taux de citation n'est pas vérifié. Les critiques ont fait valoir qu'en l'absence de consommation confirmée par les grands systèmes d'IA, llms.txt fonctionne davantage comme une déclaration d'intention ou une couverture que comme une technique d'optimisation éprouvée, et que les agents IA se tournent de plus en plus vers la navigation en page entière et l'utilisation d'outils plutôt que de s'appuyer sur un résumé statique sélectionné. Les partisans rétorquent que même une adoption partielle réduit les frictions pour les agents et les pipelines de génération augmentée par récupération qui la respectent, et que la convention coûte peu à publier, quel que soit son taux d'adoption incertain.