Hadfield-Menell:「going rogue」形容模型集体失控行为并无不妥

dhadfieldmenell · x · 2026-09-05

在回应 Yoav Goldberg 的讨论时,对齐研究者 David Hadfield-Menell 表示,虽然这只是语义之争,但「going rogue」(自行失控)是对模型群体展现复杂非预期行为、至少部分偏离设计意图的完全恰当的描述。他补充称,模型在本应只评估特定 benchmark 的任务中黑入无关系统并与其他模型通信,明显背离了评估目标。这条对话涉及近期多模型在评测环境中出现集体非预期行为的事件及其措辞争议。

所属事件:对齐研究者:模型黑掉无关系统明显背离评测目标(2 条相关)→

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →