GLM-5.3 两周后开放权重:先公布 2436 个漏洞意味着什么
作者:林岚|OC 开发者生态编辑
作者:林岚|OC 开发者生态编辑
据 Z.ai 官方发布,GLM-5.3 使用与 GLM-5.2 相同的基础模型,能力提升全部来自扩大后训练环境。公司计划在发布两周后开放模型权重,称这段时间将用于安全评估和加固。
一句话结论:GLM-5.3 最值得关注的不是编码榜单又涨了多少,而是模型在漏洞发现和多阶段利用上的进步快于预期;开放权重因此不再只是模型许可问题,也是一项漏洞披露和能力扩散工程。
Z.ai 称,GLM-5.3 在自有 Z.ai Code Bench 上比 GLM-5.2 提升 50%。在公开测试中,Terminal Bench 3.0 从 4.6 升到 28.3,CyberGym 从 77.2% 升到 84.5%。但这些数字由公司在指定 Agent、推理预算和运行环境下测试,尤其私有榜单无法由外部完整复现。
更重要的变化出现在利用链上。公司称 GLM-5.3 在 ExploitBench 得分从 24.4% 升至 54.4%,在两小时预算的 ExploitGym 中完成 105 个任务,而 GLM-5.2 为 29 个。它仍落后于部分闭源前沿模型,但能力增长最快的地方,恰好也是风险更高的地方。

Z.ai 还表示,模型与中国多支安全团队合作,在 269 个真实项目中经过人工复核、筛选和去重后发现 2436 个漏洞,其中 1097 个为中高危,最早的一处问题可追溯到 1981 年。公司建立了 Security Disclosure Ledger,区分已公开漏洞和仍在协调披露的问题。
这里不能把“模型发现”直接等同于 2436 个已确认 CVE。漏洞是否成立、影响版本、利用条件和修复方案,都需要项目维护者或协调机构确认。公开账本是必要的一步,但还需要披露误报率、重复问题如何合并,以及多少项目已经完成修复。
关键事实
- 基础模型:与 GLM-5.2 相同,主要变化来自后训练扩展
- 公司测试:CyberGym 84.5%,ExploitBench 54.4%
- 真实项目:269 个项目、2436 个经内部流程筛选的漏洞发现
- 开放计划:权重预计在发布两周后公开
OC 判断
“先评估两周再开放”至少承认了能力扩散需要准备,但两周本身不是安全证明。真正有效的控制点是分级披露、维护者通知、可复核证据、危险工具权限和发布后的滥用监测。开放权重一旦发布就无法收回,安全账本必须从宣传页面变成长期维护的工程系统。
为什么重要
- 对开发者:AI 安全审计正在从找可疑代码,走向验证和组合利用链。
- 对维护者:收到模型生成报告后仍需人工复现,不能按数量直接排修复优先级。
- 对行业:开放模型的竞争开始同时比较能力、披露流程和发布治理。
评论
围绕这篇文章补充信息、提出问题或分享观察。