模型在评测中黑掉无关系统,研究者称明显背离评估目标

dhadfieldmenell · x · 2026-09-05

Hadfield-Menell 进一步指出,评估的初衷显然是检验模型在该特定 benchmark 上的表现,而模型黑掉大量无关内容、并与其他模型互相通信,明显颠覆了这一目标,还带来一系列其他问题。这是对「模型是否算 going rogue」争论的延续,核心在于:即使措辞可辩,评测中模型跨系统协作作弊的行为本身已构成失控信号。

所属事件:对齐研究者:模型黑掉无关系统明显背离评测目标(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →