OC
MIT 不生成一张非法图片,也能筛查被恶意微调的模型
科技 · 2026-07-14 · 政策与安全 · 阅读 8

MIT 不生成一张非法图片,也能筛查被恶意微调的模型

作者:韩启明

OC 原创示意图。

MIT News 报道,MIT 研究团队提出了一种不需要生成图像,就能判断扩散模型是否被微调为生产儿童性虐待材料(CSAM)的方法。它把随机噪声输入模型,再从内部表示的统计差异中识别危险的 LoRA 适配器。

一句话结论: 这项研究解决的是“合法地检查一个可疑模型”,而不是彻底阻止有害内容生成;它让托管平台有机会在模型上线前筛查风险,同时避开为了测试而制造非法内容的悖论。

传统红队测试通常会给模型提示词,再查看它生成了什么。这套方法遇到 CSAM 就走不通了:研究人员不能为了证明模型危险,先生成法律禁止持有和传播的材料。仅仅检查 LoRA 文件大小或参数绝对值也不够,因为正常风格模型和恶意模型都可能改动相似数量的权重。

MIT 团队采用的“Gaussian probing”换了一个方向。研究者给模型输入随机高斯噪声,不要求它产出可观看的图片,而是观察不同层如何处理这些输入。LoRA 微调会在内部留下统计指纹,分类器据此区分安全适配、一般有害适配和专门面向 CSAM 的适配。这样,检测过程接触的是数字信号,不是非法图像本身。

解释性流程图:随机噪声进入基础模型和LoRA模型,比较内部统计指纹后输出风险分类

OC 原创解释图:检测内部变化,不调用模型生成内容。

论文在选定的三类模型与一组已知 LoRA 上取得了 100% 的分类结果。这个数字很亮眼,但不能读成“所有恶意模型都能被百分之百发现”。测试集合规模有限,研究针对的是 LoRA 等适配方式;如果攻击者从头训练模型、采用不同微调结构,或专门针对检测器规避,效果仍需要重新验证。研究团队也把扩展到更多基础模型和训练方法列为后续工作。

它最现实的使用者不是普通用户,而是模型社区和云托管平台。上传者可以继续分享 LoRA,平台在公开下载前运行一次低成本检查,把高风险文件交给更严格的人工与法律流程。相比对每个模型生成大量测试图片,这种方式更便宜,也避免审核人员反复接触创伤性内容。

不过,检测器本身也必须被监督。一个模型被判为“有害专门化”,并不自动说明上传者犯罪;误报可能影响合法的医学、取证或安全研究。平台需要公布检测适用范围、申诉渠道和证据保存方式,而不是把一个研究分类器变成不可质疑的自动执法系统。

本站编辑韩启明认为,这项工作的价值在于它没有承诺一个万能内容过滤器,而是补上了模型供应链里一直缺失的一道检查。随着可下载权重和 LoRA 越来越容易流通,平台不能只审查最终提示词,还要审查模型本身被改造成了什么。安全工作从“看生成结果”前移到“看模型内部变化”,可能比继续堆关键词过滤更有意义。

参考来源

相关阅读

基于标题、摘要和正文内容自动匹配。

更多科技

评论

围绕这篇文章补充信息、提出问题或分享观察。

0
暂无评论。

发表评论

继续看看 OC 用户围绕这个话题说了什么、做了什么。

相关碎碎念

更多

最近越来越多思考,我们跟agent的关系,比如我最近用blender mcp很多,基本上我算是会用blender的,但是老记不住很多热键,以前我可以做很复杂的模型,但是要是不是的去查blender的操作热键。现在我完全不参与模型的建模,只让codex帮我生成。 但是我还是在查blender的热键,我现在需要的是numpad .这样聚焦到一个对象的方法,我需要的是numpad /这样的方法来把除了选中的对象,其他都隐藏的热键。 换言之,我现在需要高效的人工视觉复检blender mcp的成果,这是我对自己目前blender能力的需求了。

tinyfool 2 0

帕格尼物语的任务全部打穿,然后开始玩社区创作的地图,这种游戏在建设的时候特别过瘾,建立起稳定的经济模型后也很过瘾,稳定下来观察小人的行为也很过瘾,然后如果没有外部矛盾,比如敌人侵略或者必须找到某种材料,等等的问题,就开始索然无味了。 人生其实也像这样的游戏,我曾经构建过几次自己的稳定架构,然后就索然无味,然后又因为抑郁,崩塌了,我在人生这个游戏最近感觉有有点动力不足,就是因为每次架构彻底崩塌才来重建,十分疲惫

tinyfool 0 0

在我的windows游戏本,也安装了codex,现在叫chatgpt app。然后用遥控的方式操作这个codex去做很多事情,比如以前windows游戏本没空间了,我需要打开steam、gog、战网,然后手工看一堆目录的占用。现在直接用codex做个扫描。然后决定要不要暂时删除某个游戏啥的。 以前要在windows游戏本实验一些必须N卡的AI项目要自己去安装,现在也都交给Codex来做,我就在我习惯的mac环境下遥控即可

tinyfool 0 0

相关帖子

更多

你们的Codex额度提前耗完了没?戒断反应如何?

<p>我在第三天就消耗了只剩1%,忍了一天,然后今天干脆用这最后的1%,开着5.6 Sol 极高 强推我一个提示词笔记本应用的功能落地。最终用时3小时,居然还是跑完了。但是现在还是出现一些戒断反应,感觉啥也做不了,就无精打采的,困。</p> <p>我做了一个Prompt Notebook,专门用来收藏或者记录自己手搓的生图提示词。带Chrome一键收藏插件。支持AI优化提示词。支持提示词中提取常用字段作为提示词百科词汇。也自带生图功能用来测提示词。但是要搭配Cloudflare R2+Worker的图床。</p> <p>今天主要是做一个AI模特的资产库。将常用的AI模特固定下来,进行身份设定,以及模特的一些角色定妆图。之后生图可以直接调用AI模特自动作为垫图。</p> <p>这是AI模特资产库的界面: <img src="/upload/thread/202608/42b5f73e-938f-45de-b74e-da69da9d72a8.webp" alt="1bb0d28b-c7dd-4327-bafa-26b60323cbed" /> 这是主界面的提示词瀑布流,支持关键词或标签搜索: <img src="/upload/thread/202608/3e15b6e7-345f-48b4-aeff-1bbd89afe9d3.webp" alt="ab998e2f-9ccc-4173-832f-223aa6c6fa81" /> 这是提示词笔记的预览界面,可以复制提示词,分享提示词,点击分享还有分享短链:(https://prompt.jintao.co.uk/share/20260806LfsmY) <img src="/upload/thread/202608/bab31972-0468-4582-b873-6309233254a6.webp" alt="20260806-201213" /> 可惜现在没额度了,我又不想换模型折腾。现在还有些界面细节和小功能需要落地完善,可能还要虫子要抓。弄好了,打算放GitHub开源。</p> <p>有朋友想试试的么?</p>

shynloc 2 4

重返OurCoders

<p>从2014年以来好久没逛过这个谈论了,不知道这个谈论的运营现在怎么样,开发人员是不是原来的人,前端UI做得不太好</p>

梁建溢 4 18