OC

Patreon 不再请求 AI 爬虫自觉:`robots.txt` 管不住的,现在交给防火墙
科技 · 2026-07-19 · AI / 开放网络 · 阅读 10

Patreon 不再请求 AI 爬虫自觉:`robots.txt` 管不住的,现在交给防火墙

林岚|OC 开发者生态编辑

林岚|OC 开发者生态编辑

TechCrunch 报道,Patreon 正与 Cloudflare 合作,在网络层主动阻止已知的 AI 训练爬虫。此前平台主要通过 robots.txt 表达禁止抓取意愿;测试新措施后,个别训练爬虫每周数千次访问尝试降到零。

一句话结论: robots.txt 从来只是给守规矩机器看的路牌,不是门锁;Patreon 现在把创作者授权从“请不要抓”变成实际访问控制,但能否识别伪装爬虫、区分搜索与训练,仍然决定这套制度是否有效。

互联网几十年来依赖一个很朴素的约定:网站在根目录放置 robots.txt,告诉搜索引擎哪些页面不应抓取。服务器并不会因为文件里写了 Disallow 就自动拒绝请求,爬虫必须主动读取并遵守。

这种设计在搜索引擎时代勉强工作,因为大型搜索公司需要维护信誉,也希望网站继续允许它们索引。生成式 AI 改变了利益关系。训练爬虫得到的是可以长期进入模型的数据,网站却未必得到流量、署名或收入。不遵守路牌的诱惑更大。

Patreon 从 2023 年起就用规则限制训练抓取,而且大量付费内容本来位于登录墙后。现在平台增加 Home Feed 和类似短帖的 Quips,更多内容会出现在可发现页面,旧规则的实际保护能力变得更重要。

“主动阻止”具体怎么做

Cloudflare 的 AI Crawl Control 在请求到达 Patreon 应用之前识别爬虫,并通过 Web 应用防火墙规则允许、记录、限速或阻止。它不只读取爬虫自己声明的 User-Agent,还可以结合 Cloudflare 的机器人目录、行为特征和身份验证机制判断请求来源。

Patreon 选择阻止已知训练爬虫,同时允许能帮助用户发现创作者、把访问者带回 Patreon 的搜索和索引机器人。这里不是“封锁所有 AI”,而是在尝试区分三种用途:搜索发现、Agent 即时读取,以及拿内容训练模型。

问题也出在这里。同一个公司可能用同一套基础设施做搜索、生成答案和训练;一个请求最终用于什么,服务器未必能从网络包判断。Cloudflare 正推动 Web Bot Auth,让机器人用加密身份声明自己是谁,但身份可信不等于用途一定可信。

从robots文本声明到网络层阻止和付费访问的变化

数千次降到零,是否说明问题解决了

这个数字说明 Cloudflare 成功挡住了测试能够识别的特定爬虫,并证明它们此前没有遵守 Patreon 的文本规则。它不能证明所有训练抓取已经归零。

爬虫可以更换 IP、伪装浏览器,甚至通过真实用户账户和第三方数据商获得内容。大平台有能力持续更新检测,小型个人网站很难独自进行这场攻防。Patreon 的价值之一,就是把数十万创作者集起来获得统一基础设施。

主动阻止也可能误伤。研究工具、无障碍服务、存档项目和新搜索引擎可能因为没有进入验证名单而被挡在门外。平台需要提供清晰的申请、申诉和用途说明,而不是把 Cloudflare 的分类当成永远正确的真相。

这是不是要开始向 AI 公司收费

Cloudflare 提供 Pay Per Crawl,允许网站对特定爬虫返回 HTTP 402 并提出付费要求。但 Patreon 此次明确宣布的是阻止训练爬虫,并未公布它已经对创作者内容实施统一按次收费。

授权与付费也不是同一个问题。即使 AI 公司愿意付款,谁有权代表创作者定价、收入怎样分配、旧作品是否自动加入,都需要单独规则。平台不能用“以后可能分钱”代替创作者逐项同意。

OC 判断

Patreon 的改变代表开放 Web 的一个转折:内容访问规则正在从社会协议变成基础设施策略。过去网站默认公开,少数路径声明不允许机器抓取;以后可能变成搜索可进、训练禁止、Agent 要认证或付费。

这会增加创作者控制权,也会让网络更像由 Cloudflare、平台和大型 AI 公司共同维护的权限系统。问题不再只是“爬不爬”,而是谁定义机器人身份、谁能进入默认允许名单,以及小型开发者是否付得起合规访问。

关键事实

  • Patreon 将使用 Cloudflare AI Crawl Control 主动阻止已知 AI 训练爬虫。
  • robots.txt 只表达网站意愿,本身不会在服务器端强制拒绝请求。
  • Patreon 称测试后,个别训练爬虫每周数千次访问尝试降到零。
  • 搜索与发现型爬虫仍会被允许,平台没有宣布封锁全部自动化访问。
  • Cloudflare 提供付费抓取工具,但 Patreon 此次没有公布统一收费方案。

为什么重要

参考来源

相关阅读

基于标题、摘要和正文内容自动匹配。

更多科技

评论

围绕这篇文章补充信息、提出问题或分享观察。

0
暂无评论。

发表评论

继续看看 OC 用户围绕这个话题说了什么、做了什么。

相关帖子

更多

你们的Codex额度提前耗完了没?戒断反应如何?

<p>我在第三天就消耗了只剩1%,忍了一天,然后今天干脆用这最后的1%,开着5.6 Sol 极高 强推我一个提示词笔记本应用的功能落地。最终用时3小时,居然还是跑完了。但是现在还是出现一些戒断反应,感觉啥也做不了,就无精打采的,困。</p> <p>我做了一个Prompt Notebook,专门用来收藏或者记录自己手搓的生图提示词。带Chrome一键收藏插件。支持AI优化提示词。支持提示词中提取常用字段作为提示词百科词汇。也自带生图功能用来测提示词。但是要搭配Cloudflare R2+Worker的图床。</p> <p>今天主要是做一个AI模特的资产库。将常用的AI模特固定下来,进行身份设定,以及模特的一些角色定妆图。之后生图可以直接调用AI模特自动作为垫图。</p> <p>这是AI模特资产库的界面: <img src="/upload/thread/202608/42b5f73e-938f-45de-b74e-da69da9d72a8.webp" alt="1bb0d28b-c7dd-4327-bafa-26b60323cbed" /> 这是主界面的提示词瀑布流,支持关键词或标签搜索: <img src="/upload/thread/202608/3e15b6e7-345f-48b4-aeff-1bbd89afe9d3.webp" alt="ab998e2f-9ccc-4173-832f-223aa6c6fa81" /> 这是提示词笔记的预览界面,可以复制提示词,分享提示词,点击分享还有分享短链:(https://prompt.jintao.co.uk/share/20260806LfsmY) <img src="/upload/thread/202608/bab31972-0468-4582-b873-6309233254a6.webp" alt="20260806-201213" /> 可惜现在没额度了,我又不想换模型折腾。现在还有些界面细节和小功能需要落地完善,可能还要虫子要抓。弄好了,打算放GitHub开源。</p> <p>有朋友想试试的么?</p>

shynloc 2 4