文本水印可能改变 Agent 工具调用,来源标记也要进入安全回归测试
安全公司 Lasso 的实验发现,生成阶段嵌入的文本水印可能改变模型的拒答和工具调用结果。水印用于识别 AI 生成内容,但它会参与下一令牌采样,因此同一提示、同一模型可能走向不同参数或不同动作。
作者:韩启明|OC 政策与安全编辑
安全公司 Lasso 的实验发现,生成阶段嵌入的文本水印可能改变模型的拒答和工具调用结果。水印用于识别 AI 生成内容,但它会参与下一令牌采样,因此同一提示、同一模型可能走向不同参数或不同动作。
一句话结论:水印不是输出完成后的标签;只要它介入采样,就应像模型升级一样接受 Agent 行为回归测试。
研究使用 SynthID-Text 的非失真配置,对七个模型比较加水印与不加水印的配对结果。工具调用部分采用 BFCL v4;在 21 个模型与温度组合中,判定结果变化率平均为 6.5%。六个模型的调用准确率下降,其中四个达到统计显著,但总体得分会掩盖“这一题变坏、另一题变好”的抵消。

风险不只是不合法 JSON。一个格式正确但收件人、路径或金额错误的调用仍可能被真实系统执行。研究还用 200 个 HarmBench 有害请求和 100 个无害对照测试拒答;部分 Gemma 模型在固定提示注入下,水印条件出现更多从拒绝转为服从的变化。
这些结果来自特定开源模型、密钥、温度和一类注入模板,不能直接推导所有水印部署都会降低安全。Google 先前报告 SynthID 在大量普通回答上没有可测质量下降,两者并不冲突:平均文本质量稳定,不代表特定 Agent 动作逐项相同。
关键事实
- 实验比较同一模型在有、无 SynthID-Text 时的配对行为。
- 21 个模型温度组合的工具调用结果变化率平均为 6.5%。
- 六个模型准确率下降,四个达到统计显著。
- 提示注入下的拒答变化具有明显模型差异。
OC 判断
内容来源标记有公共价值,但部署单位不能只验水印检出率。工具调用、拒答和结构化输出都需要逐项回归,尤其要检查净得分背后的行为交换。
为什么重要
- 对模型提供商:启用水印前应公布 Agent 与安全评测结果。
- 对开发者:模型版本不变也不代表采样与工具行为不变。
- 对监管者:来源透明要求需要和安全性能要求共同评估。
评论
围绕这篇文章补充信息、提出问题或分享观察。