从 DeepSeek 蒸馏能力,会不会也继承审查:一项实验给出否定答案,但证据还不够
作者:韩启明|OC 政策与安全编辑
作者:韩启明|OC 政策与安全编辑
据研究机构 CTGT 发布的实验,一组研究者尝试回答一个敏感问题:学生模型通过教师模型生成的数据学习推理能力时,会不会把教师在政治问题上的拒答和审查行为一并继承。团队报告称,学生模型在金融推理任务上获得明显提升,但其审查倾向与对照组差距很小。
一句话结论:这项实验说明“能力迁移”和“政策行为迁移”可能可以分离,却不足以证明蒸馏不会传递审查;结果取决于训练数据里有没有触发相关行为、评测覆盖哪些语言和主题,以及学生模型原本接受过什么训练。
蒸馏不是把一个模型完整复制到另一个模型。常见做法是让能力更强的教师生成答案、推理轨迹或偏好数据,再用这些样本训练较小或更开放的学生模型。学生看到的是教师在特定提示下产生的输出,而不是教师全部参数、系统提示和安全分类器。
因此,如果蒸馏数据集中主要是金融推理题,教师很少遇到政治敏感问题,学生就没有足够信号去学习相同拒答模式。它能学会“怎样分析资产负债表”,不代表也会学会“在什么政治问题上拒答”。这不是审查神秘地消失,而是监督信号没有覆盖那部分行为。

研究者使用自建的 LineageEval 等方法比较模型能力与行为,并报告金融推理准确率约 83.61%,审查指标差异约 0.43 分。这里必须保留两个限定。第一,数据与指标由研究团队选择,尚不能代替跨机构复现;第二,“审查”不是一个单轴属性,它会随语言、人物、地区、措辞、上下文和部署系统变化。
学生模型也可能已经通过自身预训练和对齐形成政治行为。若它原本更少拒答,有限的蒸馏样本未必能改变这一点;若训练数据刻意包含大量敏感触发,结果可能完全不同。更严格的实验需要控制学生基线、数据配比、教师接口、系统提示和解码参数,并在中文、英文及多轮对话中重复测试。
这项研究仍然有现实价值。围绕中国模型的讨论经常把“模型来源”“训练数据来源”和“最终部署行为”混为一谈。开放权重模型可以继续微调、删除安全层、增加本地策略,也可以在企业网关处重新加控制。判断风险时,应测量实际交付的模型与系统,而不是只根据教师模型国籍推断学生行为。
关键事实
- 来源:CTGT 研究文章及其公开评测说明
- 涉及模型:研究中使用的教师模型、GPT-OSS-120B 学生模型及若干对照模型
- 核心技术:监督蒸馏、合成数据、行为评测与模型谱系分析
- 关键数字:研究报告金融推理准确率 83.61%,审查指标差异约 0.43 分
OC 判断
风险要拆开看。蒸馏最容易传递的是训练样本反复展示的行为,不是教师模型所有隐藏属性。这个结果反驳了“只要向中国模型学习就必然继承全部审查”的简单叙事,却不能推出“蒸馏天然安全”。政策和采购应要求公开评测数据、目标语言和部署控制,而不是用模型血统一票否决。
为什么重要
- 对开发者:选择蒸馏数据时,数据覆盖范围会直接决定学生学到哪些能力和偏差。
- 对企业:采购模型应对实际版本做业务场景评测,不能只看教师模型或基础模型名称。
- 对监管者:限制模型来源无法替代对最终系统行为、数据和权限的验证。
评论
围绕这篇文章补充信息、提出问题或分享观察。