OC

Knowledge OS
Patreon 不再请求 AI 爬虫自觉:`robots.txt` 管不住的,现在交给防火墙
科技 · 2026-07-19 · AI / 开放网络 · 阅读 2

Patreon 不再请求 AI 爬虫自觉:`robots.txt` 管不住的,现在交给防火墙

林岚|OC 开发者生态编辑

林岚|OC 开发者生态编辑

TechCrunch 报道,Patreon 正与 Cloudflare 合作,在网络层主动阻止已知的 AI 训练爬虫。此前平台主要通过 robots.txt 表达禁止抓取意愿;测试新措施后,个别训练爬虫每周数千次访问尝试降到零。

一句话结论: robots.txt 从来只是给守规矩机器看的路牌,不是门锁;Patreon 现在把创作者授权从“请不要抓”变成实际访问控制,但能否识别伪装爬虫、区分搜索与训练,仍然决定这套制度是否有效。

互联网几十年来依赖一个很朴素的约定:网站在根目录放置 robots.txt,告诉搜索引擎哪些页面不应抓取。服务器并不会因为文件里写了 Disallow 就自动拒绝请求,爬虫必须主动读取并遵守。

这种设计在搜索引擎时代勉强工作,因为大型搜索公司需要维护信誉,也希望网站继续允许它们索引。生成式 AI 改变了利益关系。训练爬虫得到的是可以长期进入模型的数据,网站却未必得到流量、署名或收入。不遵守路牌的诱惑更大。

Patreon 从 2023 年起就用规则限制训练抓取,而且大量付费内容本来位于登录墙后。现在平台增加 Home Feed 和类似短帖的 Quips,更多内容会出现在可发现页面,旧规则的实际保护能力变得更重要。

“主动阻止”具体怎么做

Cloudflare 的 AI Crawl Control 在请求到达 Patreon 应用之前识别爬虫,并通过 Web 应用防火墙规则允许、记录、限速或阻止。它不只读取爬虫自己声明的 User-Agent,还可以结合 Cloudflare 的机器人目录、行为特征和身份验证机制判断请求来源。

Patreon 选择阻止已知训练爬虫,同时允许能帮助用户发现创作者、把访问者带回 Patreon 的搜索和索引机器人。这里不是“封锁所有 AI”,而是在尝试区分三种用途:搜索发现、Agent 即时读取,以及拿内容训练模型。

问题也出在这里。同一个公司可能用同一套基础设施做搜索、生成答案和训练;一个请求最终用于什么,服务器未必能从网络包判断。Cloudflare 正推动 Web Bot Auth,让机器人用加密身份声明自己是谁,但身份可信不等于用途一定可信。

从robots文本声明到网络层阻止和付费访问的变化

数千次降到零,是否说明问题解决了

这个数字说明 Cloudflare 成功挡住了测试中能够识别的特定爬虫,并证明它们此前没有遵守 Patreon 的文本规则。它不能证明所有训练抓取已经归零。

爬虫可以更换 IP、伪装浏览器,甚至通过真实用户账户和第三方数据商获得内容。大平台有能力持续更新检测,小型个人网站很难独自进行这场攻防。Patreon 的价值之一,就是把数十万创作者集中起来获得统一基础设施。

主动阻止也可能误伤。研究工具、无障碍服务、存档项目和新搜索引擎可能因为没有进入验证名单而被挡在门外。平台需要提供清晰的申请、申诉和用途说明,而不是把 Cloudflare 的分类当成永远正确的真相。

这是不是要开始向 AI 公司收费

Cloudflare 提供 Pay Per Crawl,允许网站对特定爬虫返回 HTTP 402 并提出付费要求。但 Patreon 此次明确宣布的是阻止训练爬虫,并未公布它已经对创作者内容实施统一按次收费。

授权与付费也不是同一个问题。即使 AI 公司愿意付款,谁有权代表创作者定价、收入怎样分配、旧作品是否自动加入,都需要单独规则。平台不能用“以后可能分钱”代替创作者逐项同意。

OC 判断

Patreon 的改变代表开放 Web 的一个转折:内容访问规则正在从社会协议变成基础设施策略。过去网站默认公开,少数路径声明不允许机器抓取;以后可能变成搜索可进、训练禁止、Agent 要认证或付费。

这会增加创作者控制权,也会让网络更像由 Cloudflare、平台和大型 AI 公司共同维护的权限系统。问题不再只是“爬不爬”,而是谁定义机器人身份、谁能进入默认允许名单,以及小型开发者是否付得起合规访问。

关键事实

  • Patreon 将使用 Cloudflare AI Crawl Control 主动阻止已知 AI 训练爬虫。
  • robots.txt 只表达网站意愿,本身不会在服务器端强制拒绝请求。
  • Patreon 称测试后,个别训练爬虫每周数千次访问尝试降到零。
  • 搜索与发现型爬虫仍会被允许,平台没有宣布封锁全部自动化访问。
  • Cloudflare 提供付费抓取工具,但 Patreon 此次没有公布统一收费方案。

为什么重要

  • 对开发者: 构建 Agent 或搜索服务时,不能再假设公开网页都可无条件抓取,需要识别用途并尊重网络层策略。
  • 对创作者: 平台终于提供比文本声明更强的保护,但授权范围和收益分配仍需透明。
  • 对用户: 内容控制增强可能减少未经同意的训练,也可能让部分搜索、存档和 AI 工具无法访问原文。

参考来源

相关阅读

基于标题、摘要和正文内容自动匹配。

更多科技

评论

围绕这篇文章补充信息、提出问题或分享观察。

0
暂无评论。

发表评论