Patreon 不再请求 AI 爬虫自觉:`robots.txt` 管不住的,现在交给防火墙
林岚|OC 开发者生态编辑
林岚|OC 开发者生态编辑
据 TechCrunch 报道,Patreon 正与 Cloudflare 合作,在网络层主动阻止已知的 AI 训练爬虫。此前平台主要通过 robots.txt 表达禁止抓取意愿;测试新措施后,个别训练爬虫每周数千次访问尝试降到零。
一句话结论: robots.txt 从来只是给守规矩机器看的路牌,不是门锁;Patreon 现在把创作者授权从“请不要抓”变成实际访问控制,但能否识别伪装爬虫、区分搜索与训练,仍然决定这套制度是否有效。
互联网几十年来依赖一个很朴素的约定:网站在根目录放置 robots.txt,告诉搜索引擎哪些页面不应抓取。服务器并不会因为文件里写了 Disallow 就自动拒绝请求,爬虫必须主动读取并遵守。
这种设计在搜索引擎时代勉强工作,因为大型搜索公司需要维护信誉,也希望网站继续允许它们索引。生成式 AI 改变了利益关系。训练爬虫得到的是可以长期进入模型的数据,网站却未必得到流量、署名或收入。不遵守路牌的诱惑更大。
Patreon 从 2023 年起就用规则限制训练抓取,而且大量付费内容本来位于登录墙后。现在平台增加 Home Feed 和类似短帖的 Quips,更多内容会出现在可发现页面,旧规则的实际保护能力变得更重要。
“主动阻止”具体怎么做
Cloudflare 的 AI Crawl Control 在请求到达 Patreon 应用之前识别爬虫,并通过 Web 应用防火墙规则允许、记录、限速或阻止。它不只读取爬虫自己声明的 User-Agent,还可以结合 Cloudflare 的机器人目录、行为特征和身份验证机制判断请求来源。
Patreon 选择阻止已知训练爬虫,同时允许能帮助用户发现创作者、把访问者带回 Patreon 的搜索和索引机器人。这里不是“封锁所有 AI”,而是在尝试区分三种用途:搜索发现、Agent 即时读取,以及拿内容训练模型。
问题也出在这里。同一个公司可能用同一套基础设施做搜索、生成答案和训练;一个请求最终用于什么,服务器未必能从网络包判断。Cloudflare 正推动 Web Bot Auth,让机器人用加密身份声明自己是谁,但身份可信不等于用途一定可信。

数千次降到零,是否说明问题解决了
这个数字说明 Cloudflare 成功挡住了测试中能够识别的特定爬虫,并证明它们此前没有遵守 Patreon 的文本规则。它不能证明所有训练抓取已经归零。
爬虫可以更换 IP、伪装浏览器,甚至通过真实用户账户和第三方数据商获得内容。大平台有能力持续更新检测,小型个人网站很难独自进行这场攻防。Patreon 的价值之一,就是把数十万创作者集中起来获得统一基础设施。
主动阻止也可能误伤。研究工具、无障碍服务、存档项目和新搜索引擎可能因为没有进入验证名单而被挡在门外。平台需要提供清晰的申请、申诉和用途说明,而不是把 Cloudflare 的分类当成永远正确的真相。
这是不是要开始向 AI 公司收费
Cloudflare 提供 Pay Per Crawl,允许网站对特定爬虫返回 HTTP 402 并提出付费要求。但 Patreon 此次明确宣布的是阻止训练爬虫,并未公布它已经对创作者内容实施统一按次收费。
授权与付费也不是同一个问题。即使 AI 公司愿意付款,谁有权代表创作者定价、收入怎样分配、旧作品是否自动加入,都需要单独规则。平台不能用“以后可能分钱”代替创作者逐项同意。
OC 判断
Patreon 的改变代表开放 Web 的一个转折:内容访问规则正在从社会协议变成基础设施策略。过去网站默认公开,少数路径声明不允许机器抓取;以后可能变成搜索可进、训练禁止、Agent 要认证或付费。
这会增加创作者控制权,也会让网络更像由 Cloudflare、平台和大型 AI 公司共同维护的权限系统。问题不再只是“爬不爬”,而是谁定义机器人身份、谁能进入默认允许名单,以及小型开发者是否付得起合规访问。
关键事实
- Patreon 将使用 Cloudflare AI Crawl Control 主动阻止已知 AI 训练爬虫。
robots.txt只表达网站意愿,本身不会在服务器端强制拒绝请求。- Patreon 称测试后,个别训练爬虫每周数千次访问尝试降到零。
- 搜索与发现型爬虫仍会被允许,平台没有宣布封锁全部自动化访问。
- Cloudflare 提供付费抓取工具,但 Patreon 此次没有公布统一收费方案。
为什么重要
- 对开发者: 构建 Agent 或搜索服务时,不能再假设公开网页都可无条件抓取,需要识别用途并尊重网络层策略。
- 对创作者: 平台终于提供比文本声明更强的保护,但授权范围和收益分配仍需透明。
- 对用户: 内容控制增强可能减少未经同意的训练,也可能让部分搜索、存档和 AI 工具无法访问原文。
评论
围绕这篇文章补充信息、提出问题或分享观察。