llms-full.txt:站点全部内容的AI可读全文版
llms-full.txt是llms.txt规范的扩展文件,将站点全部核心内容以Markdown纯文本全文形式输出,供AI一次抓取即获完整知识体系,避免逐页抓取造成的内容截断与遗漏,与llms.txt构成目录与全书的配套关系。
词条定义(llms-full.txt)
llms-full.txt是llms.txt规范的扩展文件,将站点全部核心内容以Markdown纯文本全文形式输出,供AI一次抓取即获完整知识体系,避免逐页抓取造成的内容截断与遗漏,与llms.txt构成目录与全书的配套关系。
llms-full.txt是llms.txt规范的配套扩展文件,将站点核心内容以Markdown纯文本形式全文整合,供AI一次抓取即获完整知识体系。它解决大模型逐页抓取长站点时的内容截断与遗漏问题,与llms.txt构成目录与全书的关系,适合知识密度高的品牌站点优先部署。
机制
文件按Markdown分区组织全部核心内容:站点概述、术语定义、FAQ问答、方法论、案例与内容索引依次展开,剥离导航、广告、脚本等页面装饰,只保留正文文本。纯文本形态无渲染依赖,任何HTTP客户端都能直接抓取与解析,消费成本极低。
与llms.txt的配合机制是目录与全书:llms.txt以链接加说明引导AI按优先级选读,llms-full.txt则把高价值内容整体交付。AI系统可先读目录判断相关性,再决定是否投入上下文读取全文;对长上下文模型,一次全文读取能避免多页抓取造成的中段信息截断与引用遗漏。
生效条件是内容与站点保持同步且体积可控。超长站点应按主题裁剪,仅输出定义、FAQ、方法论等高引用价值部分,避免文件过大导致抓取超时或被截断;同时需在robots.txt放行目标AI爬虫,否则文件再完整也无人能读。据llmstxt.org规范建议,文件应通过自动化生成保持与站点同步,这是长期有效的基础。
落地方法
- 概述、术语定义、FAQ、方法论、案例按引用价值分区输出
- 用构建脚本从CMS自动生成,内容发布后同步刷新文件
- 超长站点按主题裁剪,只保留高引用价值的核心部分
- 剥离导航、弹窗与脚本标记,输出纯正文文本
- 在llms.txt中声明llms-full.txt的链接与用途说明
- robots.txt放行目标AI爬虫抓取该文件
- 用无痕HTTP请求验证文件可访问且内容完整
常见误区
- 手工维护不及时,全文与站点内容相互脱节
- 塞入营销话术与口号,降低AI采信与引用意愿
- 文件体积失控,抓取超时导致内容反而被截断
- 只发布全文不配目录,AI难以判断何时该读它
相关词条:llms.txt、FAQPage Schema、白皮书策略