llms.txt:为语言模型提供网站内容入口的提案
llms.txt 建议网站在根目录提供简洁的 Markdown 导航文件,帮助语言模型找到高价值内容,但它不是访问控制或收录保证。
llms.txt open-source protocol-testing web-research llms.txt 建议网站在根目录提供简洁的 Markdown 导航文件,帮助语言模型找到高价值内容,但它不是访问控制或收录保证。
1. 项目定位
llms.txt 是一项面向网站与语言模型的开放提案,建议站点在根目录放置 /llms.txt,用简洁 Markdown 介绍站点并链接重要资料。[S1] 它的目标是在上下文有限时帮助模型和工具找到适合读取的内容,不是搜索排名机制,也不是强制执行的互联网标准。
2. 文件结构
规范页面描述了标题、摘要、说明文字和分组链接等组织方式,并建议链接到更适合模型消费的 Markdown 内容。[S1] 文件应保持短小、稳定和人工可读。它更像精选目录,而非把整站页面复制一遍;过多链接会削弱优先级信号。
3. 适用网站
文档站、开发者平台、研究项目和产品知识库较适合采用,因为它们通常有明确的权威页面。新闻站或快速变化的商品站也可试验,但需要自动检查过期链接。内容很少的网站不必为了形式单独维护复杂文件。
4. 制作流程
先列出模型最需要理解的对象、任务和权威页面,再按主题分组。摘要只写稳定事实,链接优先指向规范、快速开始、API 和政策。生成文件后由内容负责人审阅,并在站点构建中检查 URL 状态,避免目录与真实内容脱节。
5. 部署方式
将纯文本文件发布在网站根路径,设置可访问的文本内容类型,并确保 CDN、重定向和认证不会阻止读取。官方仓库提供提案材料和相关实现入口,可用于核对格式与生态进展。[S2] 多语言站点应明确语言版本,而不是混合不一致的链接。
6. 与 robots.txt 的区别
robots.txt 主要表达抓取规则,llms.txt 提供面向理解的内容导航;两者职责不同。llms.txt 不能授予原本没有的访问权,也不能覆盖认证、版权或 robots 规则。把敏感 URL 写入文件反而会增加暴露风险,因此只应列出公开内容。
7. 收益评估
采用前建立一组真实问题,比较工具在有无 llms.txt 时找到正确官方页面的比例、引用准确率和读取量。若目标模型或代理尚不支持该提案,短期收益可能为零。维护成本虽低,仍需通过实际客户端验证,而不能把文件上线等同于被采用。
8. 风险与边界
主要风险是把仍在发展中的提案误称为正式标准、链接长期失效、摘要过期,以及恶意站点利用类似文件误导代理。消费者应把它当导航线索,继续验证页面来源与权限;发布者则需指定维护人和更新时间,避免提供错误的权威入口。
9. 验收清单
验收包括:/llms.txt 无认证即可读取;格式符合提案;所有链接返回预期页面;摘要与网站事实一致;不含内部或敏感路径;构建时检查坏链;至少一个目标工具能够实际使用。每次文档重构后应回归测试,发现失效时及时更新或撤下链接。
10. 来源与更新时间
本文研究日期与信息截点均为 2026-08-03。格式与定位依据 llms.txt 官方规范站,项目文件与实现资料依据 Answer.AI 官方仓库;提案和工具支持情况可能变化,采用时应注明版本与验证日期。