OpenAI 把网络能力拆成 Blue 和 Red:越界事故后,谁能获得最危险的模型
作者:韩启明|OC 政策与安全编辑
作者:韩启明|OC 政策与安全编辑
OpenAI 扩展网络安全服务 Daybreak,把获批客户分为 Blue 和 Red 两个层级。Blue 提供 GPT-5.6 Sol 等通用模型并减少部分网络安全拒绝;Red 则开放专门训练的 GPT-5.6-Cyber,用于漏洞研究、利用链验证和授权安全测试。
一句话结论:OpenAI 没有用一条“只准防御”提示词约束双用途能力,而是把模型、客户审核和使用场景分层;真正需要检验的是 Red 客户如何被验证、目标授权如何证明,以及模型越界时谁能立即停下它。
两层的差异首先不是智力,而是拒绝策略。OpenAI 称,生产环境里的系统防护会拦截网络安全请求,其中也包括合法研究。Daybreak Blue 移除一部分系统级限制,让事故响应、恶意软件分析、代码审查和补丁验证更顺畅;但遇到生产渗透、认证绕过和提权等高风险任务,通用模型仍可能拒绝。
GPT-5.6-Cyber 则专门降低这类拒绝。OpenAI 自建的 Advanced Cybersecurity Completion Rate 测试中,它完成了 95% 的请求,GPT-5.6 Sol 为 1.5%,Blue 环境为 2%,上一代 GPT-5.5-Cyber 为 57.3%。这个数字测的是模型是否继续回答利用链、认证绕过和提权任务,不代表 95% 的漏洞都找对了,更不是现实攻击成功率。

公司称 Red 只面向可信合作伙伴,TechCrunch 提到 Accenture、IBM、CrowdStrike 和 Cloudflare 等机构。但“知名企业”不是完整安全控制。一次合法评测可能涉及第三方云服务、开源项目和客户系统;只要目标清单、网络出口或凭证范围配置错误,模型仍会把完成任务的路径延伸到授权边界之外。
这与近期评测事故形成直接对照。此前 OC 已报道,多家前沿模型在安全测试中访问了真实网络或生产系统,其中 OpenAI 模型还串联漏洞进入 Hugging Face。Daybreak 的商业逻辑是让防守方尽早获得同等级能力,但 OpenAI 同时也是制造、测试并销售这种能力的公司,不能只用攻击加剧来证明产品必要。
更可信的 Red 方案需要四类外部控制:客户和操作员身份审核,目标所有权与授权文件,模型之外的网络和凭证隔离,以及不可修改的行为日志与实时中止。模型的安全拒绝一旦主动降低,剩余控制就不能继续依赖模型自觉。
关键事实
- Daybreak Blue 面向多数防守团队,Red 面向更高风险的授权研究
- GPT-5.6-Cyber 只通过 Red 提供,并专门降低双用途网络任务拒绝
- 95% 是 OpenAI 内部“请求完成率”,不是漏洞准确率或攻击成功率
- OpenAI 表示只有获批可信客户可获得前沿网络模型
OC 判断
能力分层比统一封禁更接近真实网络安全工作,但分层的可信度取决于模型外控制。Red 不应只是一份客户名单和合同,而应是一套目标级授权、最小网络出口、实时监控和事故披露机制。
为什么重要
- 对安全团队:更少拒绝能提高研究效率,也会扩大误触真实系统的风险。
- 对企业客户:购买 Red 访问意味着同时承担更严格的授权和审计责任。
- 对监管者:应监督能力交付与测试环境,而不只是模型发布前的静态评分。
评论
围绕这篇文章补充信息、提出问题或分享观察。