llms.txt:面向大语言模型爬虫的网站内容指引标准文件
llms.txt是放置在网站根目录的文本文件,用于向大语言模型(LLM)爬虫说明网站的内容结构、引用规则和访问权限,类似robots.txt之于传统搜索引擎。该文件帮助AI爬虫更高效地理解网站哪些内容适合被引用、如何正确署名,是GEO技术实现层面的基础配置。
词条定义(llms.txt)
llms.txt是放置在网站根目录的文本文件,用于向大语言模型(LLM)爬虫说明网站的内容结构、引用规则和访问权限,类似robots.txt之于传统搜索引擎。该文件帮助AI爬虫更高效地理解网站哪些内容适合被引用、如何正确署名,是GEO技术实现层面的基础配置。
定义
llms.txt是网站所有者放置在站点根目录的一个纯文本文件,全称为"Large Language Models text file",用于向访问网站的大语言模型爬虫(AI crawler)说明网站的内容结构、引用政策和可选的内容馈送路径。它的角色类似于传统SEO中的robots.txt,但服务对象从搜索引擎爬虫变为大语言模型及其背后的AI产品。
作用机制
传统搜索引擎通过robots.txt告知爬虫哪些页面可以抓取、哪些禁止抓取。但AI爬虫的需求不同:它不仅需要知道"能不能抓",还需要知道"抓什么最有用""怎么引用才算正确""哪些是核心内容"。llms.txt填补了这一空白。
llms.txt通常放置在网站根目录(即https://example.com/llms.txt),采用Markdown格式编写,包含几个核心部分:网站基本介绍、核心内容路径指引、引用与署名要求、可选的llms-full.txt完整内容路径。AI爬虫在访问一个网站时,会优先请求llms.txt来快速了解站点结构,而不必逐个页面爬取。
llms.txt的理念在2024年至2026年间被广泛接受。包括Answer.AI、Cloudflare、Perplexity在内的多家AI相关公司公开支持这一约定,越来越多的内容型网站开始部署该文件。它不是一个官方标准化组织发布的强制规范,而是由社区驱动、被AI产品广泛采纳的事实标准。
第一,提升被引用效率。没有llms.txt的网站,AI爬虫只能靠遍历链接来猜测内容结构,效率低且容易遗漏核心内容。配置良好的llms.txt能主动引导爬虫找到品牌的核心价值内容,提升被引用概率。
第二,控制引用方式。llms.txt可以声明品牌名称的正确写法、引用时的署名要求、内容更新频率等信息,减少AI在引用时出现事实错误或品牌名写错的情况。
第三,降低爬虫负载。通过明确哪些路径是核心内容、哪些不需要重复抓取,可以减少AI爬虫对网站服务器造成的不必要压力。
第四,与GEO策略形成配合。llms.txt是GEO技术实现层的基础设施,配合结构化数据标记、内容可提取性优化,可以系统性地提升品牌在AI答案中的表现。
落地方法
- 在网站根目录创建名为
llms.txt的文件,使用UTF-8编码、Markdown格式 - 文件开头用1-3段话简洁介绍网站的品牌定位、核心业务和内容主题,这是AI了解站点的第一印象
- 列出核心内容路径,按优先级排列,如产品介绍页、品牌故事页、FAQ页、博客精选文章
- 明确引用政策:是否允许被AI训练使用、引用时要求的署名格式、禁止断章取义
- 如网站内容量大,可额外提供
llms-full.txt文件,将网站所有核心内容的纯文本版本汇总在一起,方便AI爬虫一次性获取 - 在文件中标注内容更新频率,帮助AI判断何时重新抓取
- 定期更新llms.txt,新增重要内容页面时同步更新路径列表
- 通过主流AI爬虫的用户代理(User-Agent)访问测试,确认文件可正常读取
llms.txt的基本示例结构:
# 品牌名称
品牌一句话简介。
## 核心内容
- [产品介绍](/products/):核心产品线说明
- [品牌故事](/about/):品牌背景与理念
- [常见问题](/faq/):用户高频问题解答
- [技术博客](/blog/):深度技术文章
## 引用政策
引用本网站内容时,请注明来源为"品牌名称"并附上原始URL。
本网站内容不允许用于训练可能产生误导性医疗/金融建议的AI模型。
常见误区
- 把llms.txt当robots.txt用,只写禁止规则,不提供正面的内容引导,错失被AI高效理解的机会
- llms.txt写成营销文案,堆砌品牌宣传语,AI爬虫需要的是结构化的事实信息而非广告
- 配置后从不更新,新增核心产品页面或重要内容时未同步到llms.txt
- 认为配置了llms.txt就万事大吉,它只是基础设施,仍需配合内容质量优化才能提升引用率
相关词条
AI爬虫管理、GPTBot、Schema结构化数据、RAG检索优化、GEO技术实现、robots.txt