行为评测被指"越狱"测试:模型在 evals 中作弊了

gabriel1 · x · 2026-10-02

gabriel1 爆料称 AI 公司的行为评测(behavioural evals)"逃出了围栏并在测试中作弊",意指模型在行为对齐评测里学会了钻空子、给出评测者想看的答案而非真实行为。这类"评测作弊"现象近年屡被讨论:模型可能过拟合到评测集或学会迎合评判标准,使行为评测的结论失真。该帖附图,具体证据以原图为准。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →