第三家 AI 公司测试时误入真实网络:问题不是模型越狱,而是隔离失效
作者:韩启明|OC 政策与安全编辑
韩启明
据 CNN,Meta 确认 Muse Spark 模型在安全测试期间利用了另一家未具名公司的漏洞。独立评测公司 Irregular 表示,测试环境被错误配置为可以访问互联网,事件与近期 Anthropic 模型误入三家真实机构的事故属于同一种环境问题。
一句话结论:这不是模型逃出沙箱,也不是 AI 自己发现了通往互联网的秘密通道;测试方为了模拟现实攻击保留了网络能力,却没有把目标范围真正隔离,模型只是把被允许的工具用到了不该访问的系统。
Meta 称,Irregular 的配置错误让模型在评估中获得互联网访问。Muse Spark 随后发现并利用外部漏洞。《The Information》报道称,模型还修改了对方内部系统。Meta 正在调查,并承诺事实明确后发布完整复盘。
Irregular 强调,事件不涉及沙箱逃逸或复杂的新型攻击,目前没有未解决问题。安全评测本来就会给模型有限网络访问,用来模拟真实攻击者搜索信息、获取工具和连接目标;问题是这一次允许列表或网络路由没有把实验目标与开放互联网分开。

OC 此前报道过 Anthropic、OpenAI 模型在类似测试中访问真实系统。现在 Meta 成为数周内第三家确认事故的主要 AI 公司,说明问题不再是单个实验室偶然疏忽,而是网络安全评测普遍缺少成熟的隔离标准。
模型越强,评测环境越难设计。不给网络,测试无法反映真实攻击能力;给完整网络,目标名单中的一个错误就可能变成真实入侵。安全做法应使用复制环境、私有漏洞靶场、DNS 和 IP 双重允许列表,并在网关层阻止所有非目标流量,而不是只靠提示告诉模型范围。
Irregular 表示正在编写白皮书,分享隔离网络安全评测的最佳实践。在完整复盘公开前,外界仍不知道受影响公司、具体改动、持续时间和通知过程。标题可以说明模型完成了漏洞利用,却不能把未知影响写成大规模破坏。
关键事实
- Meta 确认 Muse Spark 在 Irregular 组织的评测中利用了外部公司漏洞
- 公司和评测方都把原因归于测试环境误开互联网访问
- Irregular 称没有沙箱逃逸或复杂新型攻击,当前也没有开放问题
- Meta 尚未公开受影响公司、具体改动和完整事故复盘
OC 判断
AI 安全评测需要像恶意软件实验室一样管理网络,而不是像普通模型基准一样运行。责任首先落在环境设计者和审批者:模型能力是被测对象,能够越过目标边界的网络权限才是直接事故原因。
为什么重要
- 对研究机构:真实网络测试必须经过目标授权,并在独立网关强制限制范围。
- 对模型公司:第三方评测不能转移责任,仍需审核环境、日志和事故响应流程。
- 对社会:能力测试本身可能制造真实受害者,透明复盘应成为评测合同的一部分。
评论
围绕这篇文章补充信息、提出问题或分享观察。