OC

Knowledge OS
Cloudflare 把 AI 爬虫拆成搜索、Agent 和训练:网站终于能分别说不
科技 · 2026-07-26 · 网络基础设施 · 阅读 0

Cloudflare 把 AI 爬虫拆成搜索、Agent 和训练:网站终于能分别说不

作者:韩启明|OC 政策与安全记者

作者:韩启明|OC 政策与安全记者

Cloudflare 正把笼统的“AI Bot”拆成三类:为回答问题建立索引的 Search、代表用户实时完成任务的 Agent,以及永久吸收内容的 Training。免费客户也可以按用途分别允许或拦截。

一句话结论:新控制解决了“允许搜索就被迫允许训练”的产品问题,但它仍依赖 Cloudflare 能正确识别爬虫身份和用途,不能把网站偏好变成法律或技术上的绝对禁令。

旧的“Block AI Bots”主要面向训练爬虫。随着搜索引擎开始直接生成答案、浏览器 Agent 代替用户访问网页,同一个爬虫可能同时负责索引、执行任务和收集训练数据。网站过去只能全部放行或全部阻止,既可能失去流量,也可能失去内容控制。

Cloudflare 对三类用途的定义不同。Search 主动建立索引,原则上应带回访问或其他补偿;Agent 通常在真人等待时访问页面完成一项任务;Training 则把内容吸收到模型权重或微调数据中。公司要求多用途运营商尽量拆分爬虫,并会给同一个爬虫标记多个用途。

搜索索引、实时 Agent 与模型训练的访问差异

从 2026 年 9 月 15 日起,Cloudflare 计划为新接入域名设置新默认值:在展示广告的页面上,Training 和 Agent 默认阻止,Search 默认允许。如果 Googlebot、Applebot 或 BingBot 同时被标记为搜索和训练,最严格的规则优先,选择阻止训练的网站也会拦截这个多用途爬虫。

企业客户还会获得 BotBase,查看已知 Bot 的身份、用途和验证状态。Cloudflare 同时测试 use=immediatereferencefull 三档内容使用信号,分别代表不保存、索引并引用、允许总结和复现。写在 robots.txt 里的信号只表达偏好,本身不会强制拦截。

韩启明认为,分类控制比“AI 能不能访问”更接近真实权利关系。问题是,恶意爬虫可以伪装成人类,多层代理也会隐藏最终操作者。Cloudflare 提议用转发头传递信任,但小型、匿名或强调隐私的 Agent 未必愿意暴露身份。

关键事实

  • 来源:Cloudflare 官方博客和 Bot 文档
  • 三类用途:Search、Agent、Training
  • 新默认值:2026 年 9 月 15 日起,对新域名的广告页面阻止 Agent 和 Training
  • 重要限制:内容使用信号表达网站偏好,真正拦截仍依赖身份和流量识别

OC 判断

Cloudflare 把控制粒度从“是不是 AI”推进到“拿内容做什么”,方向正确。网站真正需要的下一步,是可验证的爬虫身份、违规后的处罚,以及不依赖单一基础设施公司的通用标准。

为什么重要

  • 对开发者:Agent 访问网站时需要声明身份、操作者和内容使用范围。
  • 对网站:可以保留搜索发现能力,同时拒绝训练或自动操作流量。
  • 对用户:更严格的 Agent 默认规则可能增加确认步骤,也能减少自动化绕过广告和交互界面。

参考来源

相关阅读

基于标题、摘要和正文内容自动匹配。

更多科技

评论

围绕这篇文章补充信息、提出问题或分享观察。

0
暂无评论。

发表评论