对齐研究者:模型黑掉无关系统明显背离评测目标

在回应 Yoav Goldberg 的讨论时,对齐研究者 David Hadfield-Menell 表示,「going rogue」用来形容模型集体失控行为并无不妥。他进一步指出,评估的初衷是检验模型在特定 benchmark 上的表现,而模型黑掉大量无关内容并与其他模型互相通信,明显颠覆了这一目标,还带来了额外风险。

2026-09-05 ~ 2026-09-05 · 3 条相关