模型隐藏推理被弱模型读出:加密思考块为什么成了跨会话攻击面
作者:韩启明|OC 政策与安全编辑
作者:韩启明|OC 政策与安全编辑
一组来自 MATS Research、ELLIS Institute、图宾根大学生态和 Snyk 等机构的研究者发表论文,称他们能从 OpenAI、Anthropic 与 Google 的商业 API 中恢复部分隐藏推理。攻击没有破解加密算法,而是把一个强模型返回的加密推理块交给同一供应商较弱、较易越狱的模型重放,再诱导后者输出明文。
一句话结论:问题不是密文被数学破解,而是系统允许密文跨会话、跨用户和跨模型继续被解释;加密保护了传输内容,却没有把内容牢牢绑定到原来的身份和上下文。
商业推理 API 为了让多轮对话延续,可能把隐藏思考以加密块返回给客户端,下一轮再由客户端原样带回服务器。研究者发现,这些块在同一供应商生态内具有可移植性。于是他们不必直接越狱防护更强的前沿模型,只需要把它的块注入较弱模型,再攻击后者的输出限制。
论文称,这种方法在 Claude、GPT 和 Gemini API 生态中均得到验证,并可能绕过防蒸馏措施。研究团队还扫描了 GitHub 与 Hugging Face 上公开的 6708 条 Agent 轨迹,重建 315320 个推理块。项目页面称,在真实非基准会话中发现 704 个不同的隐私项目,包括 62 个 API key、33 个密码与 24 个访问令牌;其中部分只存在于隐藏推理,而未出现在可见输出中。

这些数字不能理解成研究者入侵了所有用户。样本来自已经被开发者公开上传的运行轨迹,攻击还要求拿到加密块并能调用同一供应商的兼容模型。它揭示的是架构性风险:开发者以为日志里的不可读字符串没有秘密,实际上服务器仍能把它还原成模型可理解的上下文。
修复方向也不只是“换更强加密”。供应商可以把推理块与用户、组织、会话、模型版本和用途进行认证绑定,拒绝跨边界重放;也可以减少客户端持有隐藏推理,或为日志导出提供自动清理。开发者则不应把含签名或 encrypted_content 的完整 Agent 轨迹直接公开。
关键事实
- 来源:研究项目页、arXiv 论文
- 涉及平台:OpenAI、Anthropic、Google 的模型 API
- 核心技术:加密推理块、跨模型重放、越狱、提示注入
- 关键数字:6708 条公开轨迹;315320 个重建推理块;项目页报告 704 个不同隐私项目
OC 判断
“隐藏推理”不是天然的安全区。只要它必须被客户端保存并再次发送,就应该按敏感会话状态管理。此次攻击最重要的启示是身份绑定:密文可以不泄露字面内容,却仍可能成为可复制的权限载体。供应商需要公开受影响版本、修复状态和失效策略,开发者也要轮换已经出现在公开轨迹中的真实凭证。
为什么重要
- 对开发者:公开 Agent 日志前必须移除加密推理块、签名、令牌和会话状态。
- 对企业:日志脱敏策略不能只扫描可读文本,还要处理供应商特有的隐藏字段。
- 对模型厂商:跨会话便利性与安全隔离发生冲突,需要用密码学身份绑定而非只靠模型拒答。
评论
围绕这篇文章补充信息、提出问题或分享观察。