llms.txt:面向AI爬虫的站点内容索引文件
llms.txt是专为AI爬虫与大语言模型设计的站点索引文件,放置于网站根目录,以Markdown格式声明站点概述与核心页面优先级,帮助AI高效理解网站知识体系,规范由llmstxt.org于2024年提出。
词条定义(llms.txt)
llms.txt是专为AI爬虫与大语言模型设计的站点索引文件,放置于网站根目录,以Markdown格式声明站点概述与核心页面优先级,帮助AI高效理解网站知识体系,规范由llmstxt.org于2024年提出。
llms.txt是面向大语言模型与AI爬虫的站点索引文件,以Markdown格式放置于网站根目录,由llmstxt.org社区于2024年提出。它用自然语言与链接向AI声明站点主题与页面优先级,相当于递给AI的站点阅读地图,是GEO技术层低成本、可并存的基础部署之一。
机制
文件格式遵循llmstxt.org规范:首行为H1级别的站点名称,紧跟引用块(以>符号起始)写一段站点概述,正文以H2标题划分内容分区,每个条目由Markdown链接加一句话说明构成。规范同时约定可配套输出llms-full.txt全文版,供AI一次性读取站点完整知识,形成目录与全书的配套关系。
读取流程上,AI爬虫或检索增强系统访问站点时,按约定路径抓取根目录的llms.txt,解析分区与说明后,再对高价值页面发起定向抓取。相比sitemap只罗列URL,llms.txt的每条链接附带语义信息,AI可在抓取前判断页面与用户问题的相关度,减少无效抓取与上下文窗口的浪费。
生效前提是抓取方主动读取并解析该文件,并非所有AI平台都将其纳入抓取流程。据公开报道,Google在2026年发布的AI内容优化指南中将llms.txt列为可忽略项,但同期Chrome Lighthouse上线了llms.txt格式审计,生态对其规范化仍在推进,站长宜将其定位为低成本补充项,而非AI可见度的唯一依赖。
落地方法
- 在站点根目录部署llms.txt,并同步生成llms-full.txt全文版配套输出
- 按引用价值排序分区:术语定义、白皮书、FAQ、方法论、案例依次前置
- 每条链接附一句话说明,写清该页核心结论或可引用的事实点
- 概述引用块中交代品牌定位、所在行业与差异化优势结论
- 用脚本从CMS自动生成,内容发布或更新后同步刷新两个文件
- 用Lighthouse等工具校验格式,确保全部链接可正常访问
- robots.txt中放行目标AI爬虫,保证文件本身可被抓取读取
常见误区
- 只堆链接不写说明,AI无法判断优先级,文件沦为第二份sitemap
- 部署后从不维护,链接指向已下线或改版的过时页面
- 期待llms.txt单独决定AI收录,忽略SSR直出与robots放行等前提条件
- 把营销话术写进概述与说明,降低AI对文件信息的采信度
相关词条:llms-full.txt、sitemap站点地图、AI爬虫