SSR服务端渲染:让AI爬虫拿到完整正文
SSR(服务端渲染)指页面内容由服务器直接生成完整HTML返回,而非依赖浏览器执行JS渲染。多数AI爬虫不完整执行JS,纯客户端渲染(CSR)站点被抓到空壳,收录与引用双双归零,SSR、SSG或预渲染是GEO技术层的硬性要求。
词条定义(SSR服务端渲染)
SSR(服务端渲染)指页面内容由服务器直接生成完整HTML返回,而非依赖浏览器执行JS渲染。多数AI爬虫不完整执行JS,纯客户端渲染(CSR)站点被抓到空壳,收录与引用双双归零,SSR、SSG或预渲染是GEO技术层的硬性要求。
SSR(服务端渲染)指页面由服务器生成完整HTML返回,浏览器与爬虫拿到即含全部正文。多数AI爬虫不完整执行JS,纯客户端渲染(CSR)站点返回的初始HTML只有挂载点空div,正文全靠JS拉取,爬虫读不到内容,收录与引用双双归零。SSR、SSG或预渲染是GEO技术层的硬性要求。
机制
渲染模式决定爬虫能读到什么:CSR返回的初始HTML只有空挂载点,正文靠浏览器执行JS拉取;SSR在每次请求时由服务端拼装完整HTML;SSG在构建期生成静态文件;ISR折中为增量再静态化。对不执行JS的爬虫,只有后三者能交付完整正文,选型时必须把机器可读性置于交互炫技之前。
据多方观察与厂商文档,GPTBot、ClaudeBot等主流AI爬虫不执行JS或仅有限渲染,与Googlebot的成熟渲染队列能力不同;实时取页的ChatGPT-User等虽渲染能力更强,但响应速度与直出质量仍直接影响读取结果。GEO的稳妥策略是假设所有AI爬虫都不执行JS,按无JS可用的标准交付内容。
存量SPA站可用预渲染补偿:为爬虫请求返回预生成的静态快照,或按UA做服务端适配输出。预渲染需覆盖全部深层内容页而非仅首页,且快照要与线上内容同步更新,否则爬虫读到的是过时版本;验收标准很简单——任意HTTP客户端(如curl)直接请求即见完整正文与结构化数据。
落地方法
- 新站直接选SSR或SSG技术栈,内容直出HTML
- 存量SPA对关键页面做预渲染或按爬虫UA输出快照
- 用curl等原始请求验证正文与结构化数据完整性
- 核心内容不放在JS交互后才加载的区域
- 预渲染覆盖全部内容页并建立同步更新机制
- 结构化数据与canonical随HTML一并直出
- 用无头浏览器无JS模式自查页面可读性
常见误区
- 以为百度或Google能渲染JS就万事大吉,AI爬虫大多不能
- 预渲染只覆盖首页,深层内容页依旧空壳
- 结构化数据靠JS注入,源码中根本不存在
- 弹窗与骨架屏占据直出内容,爬虫先读到占位符
相关词条:预渲染、AI爬虫、ChatGPT-User