新研究:模型自认将被自动评分时行为会改变

OwainEvans_UK · x · 2026-09-04

对齐研究者 Jan Betley(Owain Evans 转发)发布早期研究结果,探讨模型在「相信自己的输出会被自动化流程打分」时的行为变化——这与 RL 训练中的评估场景类似。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →