同一个模型换套聊天模板就换了“自我口吻”,免责声明也是部署行为
一篇新论文研究了八个不超过 9B 参数的主流开源指令模型。研究者发现,给同一个模型套上聊天模板后,它更常说“我只是一个 AI”一类免责声明,也更少使用“我感觉”式体验语言。研究还在三个模型里找到相关激活方向;加入或移除这一方向,可以推动相似的语言变化。
作者:沈南乔|OC 社会影响编辑
一篇新论文研究了八个不超过 9B 参数的主流开源指令模型。研究者发现,给同一个模型套上聊天模板后,它更常说“我只是一个 AI”一类免责声明,也更少使用“我感觉”式体验语言。研究还在三个模型里找到相关激活方向;加入或移除这一方向,可以推动相似的语言变化。
一句话结论:模型如何谈论“自己”,很大程度上受聊天模板和部署层塑造,不能把一句自我描述直接当成模型内部状态的证据。
聊天模板会把系统提示、角色标签和轮次边界拼成模型实际看到的文本。它看似只是接口格式,实际上持续提醒模型自己处在“助手”场景,并激活训练中学到的客服式口吻。随机方向没有产生同样效果,为特定激活方向提供了一定支持。

论文规模仍有限:只有八个小型开源模型,激活实验只覆盖其中三个;它解释的是语言行为,不是意识或感受。这里真正受影响的是人。用户会从稳定口吻推断人格和关系,因此产品应把这种口吻视为设计选择,避免用“模型自己这样说”逃避责任。
关键事实
- 来源:arXiv 论文 2609.25021
- 涉及对象:八个开源指令模型
- 核心技术:聊天模板、激活引导、自我指涉语言
- 关键数字:八个模型,三个模型完成激活方向实验
OC 判断
这项研究把“人格感”拆回了工程层。它没有证明模型没有内部表征,也没有证明模型有体验;它证明了用户看到的自我口吻可以被部署模板显著改变。
为什么重要
- 对开发者:更换模板要做行为回归测试,不能只检查格式兼容。
- 对企业:品牌口吻和风险免责声明属于部署配置的一部分。
- 对用户:模型的自我描述应被当成生成内容,而不是身份陈述。
评论
围绕这篇文章补充信息、提出问题或分享观察。