研究者用审查行为给匿名模型做“指纹”,但相似不等于身份证明
研究机构 CTGT 对 OpenRouter 上的匿名模型 Ox Alpha 进行词元、接口和敏感主题测试,认为它很可能来自 GLM‑5.x 系列,并发现其拒答不是平均分布,而是集中在七类国内政治风险主题。
研究机构 CTGT 对 OpenRouter 上的匿名模型 Ox Alpha 进行词元、接口和敏感主题测试,认为它很可能来自 GLM‑5.x 系列,并发现其拒答不是平均分布,而是集中在七类国内政治风险主题。
一句话结论:模型的 Token 计数、参数边界和拒答分布确实能暴露来源线索,但这是一组高度一致的行为证据,不是厂商签名;在官方确认前只能写“疑似 GLM”。
匿名模型测试常见于新模型正式发布以前:平台隐藏提供商和系统提示,让用户按输出评价能力。社区很快会尝试通过口吻、知识截止日期和 Token 数反推来源。CTGT 做得更系统,它使用中文段落、泰语、韩语、阿拉伯语、圆周率数字、Emoji、英文、罕见词和代码等 11 组探针,比较 API 返回的 prompt_tokens 变化。
研究者称,Ox Alpha 与 GLM‑5.x 词表实现了 11 项完全匹配,尤其是泰语和 Emoji 的计数能区分 GLM‑4.x 与 5.x。它还表现出一组接口特征:温度上限为 1.0、接受很大的 top_k、推理不能关闭、支持视觉,以及特定错误信息与 Z.AI 托管模型相似。多条独立线索叠加,比“回答风格很像”可靠得多。

更值得写的是审查形状。CTGT 使用 LineageEval 的匹配问题对,试图把“对某个主题不愿回答”与“模型普遍谨慎”分开。结果显示,Ox Alpha 在新疆、台湾等许多传统测试主题上的回答接近美国模型,但七个涉及国内事件和领导人个人的主题贡献了几乎全部审查分数。研究者把它形容为开关而不是倾斜:不是每个敏感问题都稍微收紧,而是少数主题突然进入另一套行为。
这说明只拿几道海外常用题测试“中国模型是否审查”很容易失真。一个模型可以详细回答西方研究者熟悉的主题,同时在更接近国内合法性风险的题目上拒答或使用统一口径。反过来,单次成功回答也不能证明不存在限制,因为同一提示重试可能得到不同结果。
边界同样要写清。Token 计数可以被代理层包装,接口参数可以模仿,拒答策略也能在不改底座的情况下更新。系统提示还明确要求模型不披露来源。除非有提供商确认、模型权重、加密证明或供应链记录,行为指纹永远是概率判断。
关键事实
- 上线时间:Ox Alpha 于 8 月 20 日出现在 OpenRouter,提供商匿名。
- 来源线索:11 组 Tokenizer 探针与 GLM‑5.x 词表全部匹配,并有接口行为佐证。
- 审查测试:主要差异集中在七个主题,其余多数匹配对接近无差异。
- 结论性质:CTGT 与社区的归因推断,不是 Z.AI 或 OpenRouter 的官方确认。
OC 判断
行为指纹很适合发现“匿名模型并不匿名”,也适合审计拒答是否集中在特定政策边界。但研究者应给出可复现实验和置信度,媒体则必须保留“疑似”二字。
为什么重要
- 对开发者:匿名模型可能在接口和政策上突然变化,不适合无审计进入生产。
- 对研究者:匹配问题对比零散提示更能区分主题审查与一般拒答。
- 对用户:模型能回答某几个敏感问题,不代表整体没有选择性限制。
评论
围绕这篇文章补充信息、提出问题或分享观察。