ShieldFont 让人看到原文、机器读到假话:反 AI 爬虫为何也会伤害开放网络
作者:韩启明|OC 政策与安全编辑
作者:韩启明|OC 政策与安全编辑
据 Ars Technica 报道,ShieldFont 试图用字体与网页底层文本之间的差异,对批量抓取训练数据的 AI 爬虫投毒:普通读者看到正常句子,直接读取 HTML 的机器却得到意思不同、仍然像自然语言的内容。
一句话结论:ShieldFont 不能阻止真正想读懂页面的爬虫,它做的是把低成本批量抓取变贵;代价是搜索、复制粘贴、翻译和屏幕阅读器也可能先被误伤。
它利用 OpenType 字形替换一类机制,让浏览器渲染出来的词与底层字符不同。与简单插入乱码相比,机器读到的文本仍尽量保持语法通顺,这样更不容易被训练数据清洗流程直接丢弃。对依赖下载 HTML、抽取纯文本的爬虫来说,页面仍然“可抓”,拿到的事实却已经变化。
绕过办法并不神秘。爬虫可以像真实用户一样启动浏览器,渲染页面,截图后再用 OCR 识别视觉文字。Ars 估算,按照第三方抓取服务价格,这种流程可能比直接读取 HTML 贵 5 到 13 倍。ShieldFont 防守的正是数量巨大的低成本抓取,而不是一个愿意针对单站点投入工程资源的对手。

问题也出在这里。搜索引擎、辅助技术、自动翻译和归档服务同样依赖机器可读文本。屏幕阅读器如果读出底层假句子,视障用户看到的就不是保护,而是网页主动向自己撒谎。复制引用失真还会破坏链接、检索和学术引用。
这使 ShieldFont 更像抗议性工具,而不是通用内容保护方案。它有效指出了一个现实:robots.txt 和训练退出标签只有在爬虫愿意遵守时才成立。但当防守者开始破坏机器可读性,开放 Web 原本让内容可搜索、可访问、可组合的价值也会一起受损。
关键事实
- 来源:Ars Technica、ShieldFont 项目
- 技术:OpenType 字形替换,让视觉文本与底层机器文本不一致
- 主要目标:提高大规模、低成本 AI 抓取的费用
- 已知边界:可被浏览器渲染加 OCR 绕过,并影响搜索和辅助技术
OC 判断
ShieldFont 是一项有力的概念验证,却不适合作为全站默认方案。更可持续的控制应发生在访问授权、可执行的数据许可和训练数据审计层,而不是要求每个创作者破坏自己的网页语义。开放网络不能靠让机器全部失明来保护作者。
为什么重要
- 对创作者:可以提高未经许可抓取的成本,但要先评估可访问性和搜索流量损失。
- 对开发者:视觉输出正确不再保证 DOM 语义正确,测试必须覆盖屏幕阅读器和复制操作。
- 对 AI 公司:忽视自愿退出机制,会推动网站采用更具破坏性的技术对抗。
评论
围绕这篇文章补充信息、提出问题或分享观察。