Cloudflare 把 AI 爬虫拆成搜索、Agent 和训练:网站终于能分别说不
作者:韩启明|OC 政策与安全记者
作者:韩启明|OC 政策与安全记者
Cloudflare 正把笼统的“AI Bot”拆成三类:为回答问题建立索引的 Search、代表用户实时完成任务的 Agent,以及永久吸收内容的 Training。免费客户也可以按用途分别允许或拦截。
一句话结论:新控制解决了“允许搜索就被迫允许训练”的产品问题,但它仍依赖 Cloudflare 能正确识别爬虫身份和用途,不能把网站偏好变成法律或技术上的绝对禁令。
旧的“Block AI Bots”主要面向训练爬虫。随着搜索引擎开始直接生成答案、浏览器 Agent 代替用户访问网页,同一个爬虫可能同时负责索引、执行任务和收集训练数据。网站过去只能全部放行或全部阻止,既可能失去流量,也可能失去内容控制。
Cloudflare 对三类用途的定义不同。Search 主动建立索引,原则上应带回访问或其他补偿;Agent 通常在真人等待时访问页面完成一项任务;Training 则把内容吸收到模型权重或微调数据中。公司要求多用途运营商尽量拆分爬虫,并会给同一个爬虫标记多个用途。

从 2026 年 9 月 15 日起,Cloudflare 计划为新接入域名设置新默认值:在展示广告的页面上,Training 和 Agent 默认阻止,Search 默认允许。如果 Googlebot、Applebot 或 BingBot 同时被标记为搜索和训练,最严格的规则优先,选择阻止训练的网站也会拦截这个多用途爬虫。
企业客户还会获得 BotBase,查看已知 Bot 的身份、用途和验证状态。Cloudflare 同时测试 use=immediate、reference 和 full 三档内容使用信号,分别代表不保存、索引并引用、允许总结和复现。写在 robots.txt 里的信号只表达偏好,本身不会强制拦截。
韩启明认为,分类控制比“AI 能不能访问”更接近真实权利关系。问题是,恶意爬虫可以伪装成人类,多层代理也会隐藏最终操作者。Cloudflare 提议用转发头传递信任,但小型、匿名或强调隐私的 Agent 未必愿意暴露身份。
关键事实
- 来源:Cloudflare 官方博客和 Bot 文档
- 三类用途:Search、Agent、Training
- 新默认值:2026 年 9 月 15 日起,对新域名的广告页面阻止 Agent 和 Training
- 重要限制:内容使用信号表达网站偏好,真正拦截仍依赖身份和流量识别
OC 判断
Cloudflare 把控制粒度从“是不是 AI”推进到“拿内容做什么”,方向正确。网站真正需要的下一步,是可验证的爬虫身份、违规后的处罚,以及不依赖单一基础设施公司的通用标准。
为什么重要
- 对开发者:Agent 访问网站时需要声明身份、操作者和内容使用范围。
- 对网站:可以保留搜索发现能力,同时拒绝训练或自动操作流量。
- 对用户:更严格的 Agent 默认规则可能增加确认步骤,也能减少自动化绕过广告和交互界面。
评论
围绕这篇文章补充信息、提出问题或分享观察。