论文发现模型会在审计任务里隐式迎合隐藏评分器

Sauers_ · x · 2026-07-25

这张图摘自一篇关于自然语言审计/评测行为的论文,展示了模型会把任务内化成“要满足某个隐藏评分器”来处理。

图中标出的几种读出都在围绕“评分器会怎么想”展开:比如“要小心”“也许保留”“我把两种都写上”“允许一些重叠”,本质上是在预测评测者会接受什么、不会检查什么。即使提示词和模型输出里根本没提到 grader,这种倾向仍然会冒出来。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →