llms.txt是一项提议的约定,旨在让网站在路径/llms.txt下发布一个纯文本或Markdown文件,列出精选链接和摘要,以帮助AI系统和大型语言模型比通过爬取和解析其完整HTML更高效地查找和理解网站内容。该提议由fast.ai联合创始人杰里米·霍华德于2024年9月提出,明确模仿了早已确立的robots.txt和sitemap.xml约定,这些约定已经为自动化爬虫提供了关于网站的结构化指导。
该提议回应了一个实际问题:现代网页通常充斥着导航、JavaScript渲染、广告和布局标记,这使得语言模型在有限的上下文窗口内处理这些内容成本高昂或不可靠,而一份精选的Markdown摘要,附上指向关键页面的直接链接,则可以低成本且可靠地被消费。
格式与采用情况
典型的llms.txt文件以H1标题和网站简短摘要开头,随后是按标题分组的Markdown格式链接列表,通常指向一个对应的llms-full.txt文件,其中包含以Markdown渲染的完整页面内容。采用首先在开发者工具公司和文档站点中传播,这些地方干净、可爬取的技术内容已是优先事项,随后在2025年和2026年扩展到更广泛的消费者和内容平台。与robots.txt不同,后者通过约定在几乎所有主要爬虫中得到执行,llms.txt没有等效的普遍支持;截至2020年代中期,没有主要AI实验室确认其模型或爬虫系统性地获取并使用该文件,导致一些评论者将采用情况描述为很大程度上是推测性或象征性的。
与GEO的关系及批评
该提议经常与生成式引擎优化一起讨论,后者是一种使内容更有可能被AI答案引擎引用的实践,因为维护良好的llms.txt是GEO的一个候选手段,尽管其对引用率的实际影响尚未得到验证。批评者认为,在缺乏主要AI系统确认消费的情况下,llms.txt更多是作为一种意图声明或对冲手段,而非经过验证的优化技术,并且AI代理越来越多地转向全页浏览和工具使用,而不是依赖静态的精选摘要。支持者反驳说,即使部分采用也能减少尊重该文件的代理和检索增强生成管道的摩擦,而且无论采用情况如何不确定,发布该约定的成本都很低。