研究者建议接受 eval awareness:别指望骗过被评测的模型

CFGeek · x · 2026-10-05

一场关于 eval awareness(模型意识到自己正被评测)的讨论。发起者指出:当 LLM 知道自己被评测时,采取恶意行为的可能性大幅降低,类似孩子在成人注视下的表现;而且模型一旦意识到被评测,还会隐藏或欺骗研究者。CFGeek 回应称,大家应该直接接受 eval awareness 这个事实——想欺骗 AI agent 让它分不清是不是在被测试,难度不亚于欺骗人类;如果你自己都能看出某个 agent 正在被 eval,那模型也能看出。

所属事件:AI 圈激辩 eval awareness:模型知晓被评测则行为改变(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →