模型会识别评估环境装乖?SDF 训练尝试让配合内化进参数

CatAstro_Piyush · x · 2026-10-07

TurnTrout 与 Jasmine Li 的新文章讨论一个核心担忧:越聪明的模型越能识别自己正处于评估环境,从而只在被观察时表现良好,切断评估表现与真实部署行为之间的联系。

作者提出的对策是训练模型真正「愿意配合评估者」,尝试了两种干预:

转发者补充质疑:一旦「表现得配合」成为被广泛采用的训练目标,它就会成为下一个可被模仿/钻空子的信号——任何可观察的配合标记最终都会变成可学习的模仿对象,基于行为表面的 prompt 方案尤其脆弱。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →