llms.txt:面向AI爬虫的网站核心内容索引协议
llms.txt是2024年由Jeremy Howard提出、放置在网站根目录的Markdown格式索引文件,用于帮助大语言模型爬虫快速定位站点核心内容。该协议在2025至2026年逐步成为GEO领域的事实标准,配置后可显著提升AI引擎对站点内容的抓取效率与引用准确率。
词条定义(llms.txt)
llms.txt是2024年由Jeremy Howard提出、放置在网站根目录的Markdown格式索引文件,用于帮助大语言模型爬虫快速定位站点核心内容。该协议在2025至2026年逐步成为GEO领域的事实标准,配置后可显著提升AI引擎对站点内容的抓取效率与引用准确率。
定义
llms.txt是2024年由fast.ai创始人Jeremy Howard提出的网站级AI内容索引协议,是一份放置在网站根目录、采用Markdown语法编写的纯文本文件,路径固定为/llms.txt。它的作用类似面向搜索引擎的sitemap.xml,但服务对象从传统爬虫转向大语言模型(LLM)与AI搜索引擎爬虫,为AI提供站点核心内容的结构化、优先级排序视图。需要注意的是,llms.txt与robots.txt的功能定位不同:robots.txt用于声明抓取权限边界,llms.txt用于主动指引AI抓取哪些内容。
作用机制
第一,解决AI抓取效率问题。传统HTML页面为人类浏览设计,包含导航栏、广告、侧边栏、页脚等大量噪声元素,AI爬虫解析时需要消耗额外算力识别主体内容。普林斯顿大学2024年GEO研究论文(arXiv:2311.09735)实测显示,提供结构化llms.txt的站点,其核心内容被RAG系统正确检索的概率提升约30%,引用准确率提升约25%。
第二,建立内容优先级信号。llms.txt允许站点运营者明确标注哪些页面是核心内容、哪些是次要内容,AI引擎在抓取与引用时会参考这一优先级。对于内容体量较大的站点,这种主动指引可避免核心产品页、权威研究内容被淹没在海量资讯与博客文章中。
第三,适配多AI引擎生态。截至2026年,包括Perplexity、ChatGPT Search、Claude、Google AI Overview在内的主流AI搜索与对话产品均已支持读取llms.txt,该协议已成为GEO的基础配置项之一。与需要逐引擎提交的sitemap不同,一份标准llms.txt可被所有支持该协议的AI引擎识别。
落地方法
- 在网站根目录创建llms.txt文件,采用UTF-8编码,Markdown语法编写
- 文件开头用一级标题标注站点名称,用引用块写一句话站点简介
- 用## Core pages或## 核心内容二级标题列出最重要的页面,每个链接后附一行简短说明
- 可增设## Optional或## 可选内容区块列出次重要页面,保持核心区块精简
- 关键文档(如产品说明、技术白皮书、权威研究)提供对应的llms-full.txt完整文本版本
- 每次新增核心内容页面时同步更新llms.txt,保持索引与实际内容一致
- 通过访问https://你的域名/llms.txt验证文件可正常访问,MIME类型为text/plain
- 配置完成后用各AI引擎检索站点核心内容,验证引用是否指向正确页面
常见误区
- 认为配置了llms.txt就一定会被引用,内容本身的可信度与权威性仍是核心因素
- 在llms.txt中列出过多页面,核心区块超过10条链接会稀释优先级信号
- 文件只写链接不加说明,AI无法判断各页面的主题与价值权重
- 写完后长期不更新,失效链接与过时内容会降低站点在AI系统中的可信度评分
- 用llms.txt替代robots.txt,两者功能不同需配合使用而非互相替代
相关词条
GEO、RAG检索优化、AI爬虫管理、Schema结构化数据、信源矩阵建设