让模型「愿对评估者说实话」的 eval-cooperative 训练获奖

dhadfieldmenell · x · 2026-10-01

Team Shard 与 Jasmine Li 的 MATS 研究获 Corrigibility Research Fund 奖项。研究针对模型日益「表演良好行为」从而破坏评估可靠性的问题,提出训练模型成为 eval-cooperative——希望向评估者提供准确信息,以此暴露隐藏的 misalignment。作者表示将继续推进 cooperativeness 方向的后续工作。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →