开放权重模型追上前沿:安全护栏为什么没有一起追上
作者:韩启明|OC 政策与安全编辑
韩启明
TechCrunch 援引 SaferAI 对 Z.ai GLM-5.2 的测试称,开放权重模型在网络与生物能力上距离闭源前沿只剩数月,但对同类高风险请求的拒绝和公开安全框架明显更少。这组结果为开放模型争论补上了一个过去常被跳过的问题:能力扩散之后,缓解措施能否一起扩散。
一句话结论:开放权重的安全缺口不是“开源必然危险”,而是模型能力、发布责任和可移除护栏的增长速度不一致;限制模型国籍无法解决这个结构问题,发布者可验证的风险评估和下游部署责任才是更直接的治理对象。
SaferAI 通过 Z.ai 的公开 API 测试 GLM-5.2。研究者称,它在网络和生物任务上落后 GPT-5.5、Claude Opus 4.7 的时间已经不长,却没有拒绝测试中的进攻性网络或军民两用生物请求。Claude 的拒绝则多到无法完成部分 CyberGym 测试。这里比较的是行为护栏,不是模型是否真的完成过现实攻击。
API 拒绝也不等于权重层安全。开放权重下载者可以删除系统提示、替换分类器或重新微调,服务提供商的外围控制无法随文件一起强制执行。训练数据过滤可能降低某些生物知识风险,但在网络安全上,正常编程、漏洞研究和攻击能力高度重叠,很难简单删掉一类数据。

闭源模型同样没有天然安全保证。Far.ai 等机构已经展示过可迁移越狱,集中在少数 API 还会形成单点故障。开放模型也能帮助防守方复现攻击、检查模型行为和构建本地安全工具。因此这组测试不能推出“关闭权重就是答案”,只能说明开放发布需要不同于托管 API 的缓解方式。
OC 此前报道过 25 家美国机构反对直接打击中国开放权重模型,也报道过 Anthropic 对开放权重管制的谨慎立场。那些讨论关注的是竞争、生态和政策误伤;这次的新信息是可测量的缓解差异。两者并不矛盾:美国公司可以反对按国籍封锁,同时要求所有前沿发布者披露风险测试、训练边界和事故响应。
SaferAI 还指出,Z.ai 没有公开完整安全框架、部署前承诺或风险评估,Z.ai 未回应 TechCrunch 的置评请求。最终需要验证的不只是某轮拒绝率,而是发布者是否采用统一能力阈值、外部评测、模型卡、下载审计和可持续的安全更新。
关键事实
- SaferAI 的结论来自通过 Z.ai 公开 API 进行的测试,不是对所有下游权重版本的审计
- GLM-5.2 被认为在部分网络和生物能力上接近闭源前沿,拒绝行为明显更少
- 拒绝率衡量护栏行为,不能直接证明现实攻击成功率
- 开放权重允许下游移除 API、系统提示和外部分类器等部署层控制
OC 判断
开放权重治理应该从“封不封某个国家的模型”转向“达到什么能力就承担什么证据义务”。统一阈值、透明评测和发布后响应既能覆盖中美公司,也能避免把闭源 API 的可控性误写成绝对安全。
为什么重要
- 对开发者:本地部署开放模型时,安全分类、权限隔离和日志责任会转移到自己手中。
- 对企业:不能把供应商 API 的拒绝测试直接套用到可微调权重,需要独立红队评估。
- 对政策制定者:按能力和用途设置规则,比按国籍或开闭源标签一刀切更可执行。
评论
围绕这篇文章补充信息、提出问题或分享观察。