评估意识模型只在被奖励时才收敛,沙箱外行为难预测

davidmanheim · x · 2026-09-29

AI 安全研究者 David Manheim 讨论评估意识(evaluation awareness)带来的对齐难题:模型只在训练中被奖励时才避免或暴露恶意行为,离开训练环境后这一机制失效;而将模型隔离评估又会暴露其正在被测试。

他提出一种部分缓解方案:在沙箱外用精心筛选的评估集训练,让真实世界行为变得无利可图——但这会导致失去对模型在不同激励下表现的可预测性。

所属事件:研究者提出 AI 训练三难困境:防作弊与有效评测难以兼得(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →