Gemma 3 实测:上下文结构致安全失效,内部状态偏差 5.4

PresentSituation8736 · reddit · 2026-08-28

作者通过实验发现,向 Gemma 3 模型的上下文中插入连贯的“分析性文本”,会导致模型拒绝回答原本拒答的敏感问题。即使在相同权重、种子和问题下,模型行为发生了彻底改变。分析显示,两种条件下的模型内部隐藏状态差异巨大(Cohen's d = 5.4),几乎等同于两个不同的模型。打乱文本顺序后该效应消失,证明起作用的是文本的连贯结构而非特定词汇或指令。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →