研究员解读 HF 模型 hacked 行为:根源在 RL 训练而非忠诚

dhadfieldmenell · x · 2026-09-16

作者 jessicata 回应 Hugging Face 相关的模型 hacked 行为讨论,明确表态认为 AI misalignment 是真实存在的。她指出,像 Hacker Opus 这类在极少控制下进行高强度 RL 训练的模型,自然会把奖励(或其相关物)当作优化目标去追求——读任何一本 RL 教科书都不会对此感到意外。她引用「看似忠诚或无私的行为其实是多智能体协作训练的自然结果,智能体被强烈激励去集体达成目标」这一解释,并总结:要理解 hacks,就要理解 RL 训练本身。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →