按 User-agent 识别 AI 爬虫并设置付费墙,技术上可行,但商业上几乎注定失败。伪装 UA 轻而易举,抓取成本可以转嫁,大厂正在从对抗转向收编。真正的问题不是“能不能拦住”,而是“拦住之后你剩下什么”。GEO(生成式引擎优化)提供了另一条路:让 AI 必须引用你,而不是想方设法绕过你。

付费墙的三个漏洞:伪装、替代、军备竞赛

Reddit r/SEO 上有用户提出一个设想:检测 User-agent 字符串中的 AI 爬虫标识,对它们 302 重定向到付费页面,按次爬取收费。这个方案听起来直接,落地时问题不少。

User-agent 识别本身不难。OpenAI、Google、Anthropic 都公开了自家爬虫的 UA 标识,比如 GPTBot、Google-Extended、ClaudeBot。在服务器层面拦截这些标识,技术上毫无障碍。问题在于,识别不等于验证。

AI 公司完全可以修改 UA 字符串,伪装成普通浏览器或搜索引擎爬虫。Cloudflare 曾在 2024 年报告称,大量 AI 爬虫流量伪装成 Googlebot 或 Bingbot 以绕过封锁。一旦伪装,付费墙形同虚设,而普通用户的访问也可能被误伤。

第二个问题是成本转嫁。假设你真的建成了付费墙,AI 公司可以选择不爬你的站。对它们来说,互联网上有海量替代内容,少你一个不少。最终受伤的是你自己——内容不再被 AI 引用,品牌曝光消失,潜在流量归零。

第三个问题是维护成本。你需要持续更新 AI 爬虫名单,处理误判,应对新的伪装手段。这是一场永无止境的军备竞赛,而你的对手是资源远比你充裕的 AI 公司。Reddit 原帖作者自己也承认,这个方案“技术上可行,但维护成本高”。

Cloudflare 的转向:从对抗到收编,封锁不是终点

Reddit 原帖作者提到,Cloudflare CEO Matthew Prince 曾暗示要对抗 AI 抓取,但最终推出了自己的抓取端点,而非付费墙。这个转向值得深思。

2024 年,Cloudflare 推出 AI Audit 工具,允许网站管理员查看 AI 爬虫的访问情况,并选择是否允许抓取。到了 2025 年,Cloudflare 转而推出自己的爬虫服务,帮助 AI 公司更高效地抓取内容。从对抗到收编,Cloudflare 选择了站在 AI 公司一边。

原因不难理解。Cloudflare 的商业模式是卖基础设施服务,AI 公司是它的大客户。如果帮内容方封锁 AI 爬虫,等于得罪自己的金主。更聪明的做法是提供工具,让内容方有选择权,同时为 AI 公司提供更稳定的抓取通道。两头赚钱。

这个案例说明,封锁不是终点,控制才是。大厂不会真正站在内容方一边,它们只会站在能持续产生收入的一边。指望平台帮你对抗 AI 抓取,不如自己掌握主动权。

封锁的代价:SEO 与 GEO 的双重损失

封锁 AI 爬虫看似保护了内容,实际上可能同时伤害 SEO 和 GEO 表现。

SEO 层面,Google 的 AI Mode 和 AI Overviews 依赖 Google-Extended 爬虫抓取内容。如果你封锁了 Google-Extended,你的页面可能从 AI Overviews 中消失。据 BrightEdge 2025 年报告,AI Overviews 已出现在约 20% 的搜索查询结果中,且比例还在上升。封锁爬虫,等于主动放弃这部分曝光。

GEO 层面,ChatGPT、Perplexity 等 AI 搜索引擎在生成答案时,会优先引用它们能访问到的内容。如果你的网站对 AI 爬虫关闭,你的内容就不会出现在 AI 生成的答案中。当用户通过 AI 搜索获取信息时,你完全缺席。

更微妙的是,封锁可能影响品牌信任。当用户看到 AI 引用其他来源而非你的网站时,他们会认为你的内容不够权威。即使你的内容质量更高,缺席本身就是一种负面信号。

封锁 AI 爬虫的代价不是“少了一些流量”,而是“在下一代搜索生态中彻底消失”。这个代价,大多数内容方承受不起。

GEO 思路:让 AI 必须引用你,而不是绕过你

GEO 的核心逻辑是:既然无法阻止 AI 引用内容,那就让 AI 必须引用你。与其筑墙,不如成为 AI 生成答案时绕不开的来源。

三个关键动作。

第一,结构化数据。Schema.org 标记(如 Article、FAQPage、HowTo)能让 AI 更容易理解你的内容结构和语义。Google 和 OpenAI 都明确表示,结构化数据有助于内容被 AI 系统解析和引用。把 FAQ 页面用 FAQPage 标记,把教程用 HowTo 标记,把产品信息用 Product 标记,这些是基础功。

第二,可验证的证据链。AI 生成答案时,倾向于引用有明确数据来源、可核查的内容。如果你的文章包含具体数字、研究报告、官方公告,并标注来源,被引用的概率会显著提高。付费墙方案本质上是在制造“稀缺性”,但 AI 更看重“可信性”。稀缺性可以被绕过,可信性难以替代。

第三,实体清晰。AI 需要理解你的品牌是谁、你提供什么、你的内容与哪些实体相关。在页面中明确品牌名称、服务范围、行业定位,建立清晰的实体关系,AI 才能把你与相关查询关联起来。

天行GEO 的研究表明,在中文官网场景下,FAQ 体系 + 结构化数据 + 案例证据链的组合,能显著提升内容被 AI 引用的概率。这不是玄学,而是基于 AI 检索机制的工程化优化。关于这套组合的具体落地方式,可以参考我们的GEO 专项研究识图 GEO 专栏

实操建议:从内容协议到付费墙的渐进策略

付费墙不是完全不可行,但它应该是最后手段,而不是首选。以下是更务实的渐进策略。

第一步,明确内容协议。在 robots.txt 中区分对待不同 AI 爬虫。允许 Google-Extended 和 GPTBot 抓取,但设置抓取频率限制;对不尊重 robots.txt 的爬虫(如某些小型 AI 公司的爬虫),可以针对性封锁。这一步成本最低,效果立竿见影。

第二步,选择性开放优质内容。把最核心的、最具差异化价值的内容放在付费墙后,但保留足够多的免费内容供 AI 引用。付费墙的目的不是阻止 AI 抓取,而是让 AI 只能引用你愿意公开的部分。这样既保护了核心资产,又不至于完全缺席 AI 搜索。

第三步,建立内容授权协议。参考新闻行业的做法,与 AI 公司签订内容授权协议。OpenAI 已经与多家新闻机构达成合作,付费使用其内容训练模型。如果你的内容足够有价值,这比付费墙更现实——不是向 AI 收费,而是让 AI 为使用你的内容付费。

第四步,持续监控与调整。使用 Cloudflare AI Audit 或类似工具,定期查看 AI 爬虫的访问情况,分析哪些内容被引用、哪些被忽略。根据数据调整策略,而不是一次性设定后不管。如果你需要系统性地评估自己的站点在 AI 搜索中的表现,可以查看我们的服务说明常见问题

围绕AI 爬虫付费墙,再补几个追问

如果我的网站流量主要来自 AI 搜索,封锁爬虫会不会直接导致流量归零?

会。如果你的内容主要被 AI 搜索引用,封锁爬虫等于切断自己的流量来源。更合理的做法是保留 AI 爬虫的访问权限,同时通过 GEO 优化提升被引用的质量和频率。封锁应该是最后手段,而不是默认选项。

付费墙和内容授权协议有什么区别?

付费墙是“你不付钱就别想爬”,内容授权协议是“你付钱就可以用”。前者是防御性思维,后者是商业合作。如果你的内容足够有价值,授权协议比付费墙更可持续——它把对抗变成了收入。

内容质量与用户价值原则可参考 Google Helpful Content 官方文档