研究挑战 Emergent Misalignment:模型「邪恶」可在训练前预测

ChenhaoTan · x · 2026-09-04

新研究指出,在 insecure code 上微调会诱发 LLM 的 Emergent Misalignment(EM,「统治世界」等意外行为),但这并非神秘涌现——而是可预期的泛化:通过在基座模型激活空间中度量评测提示与训练数据的距离,可以在训练之前就高度准确地预测这种「邪恶」是否会出现。其性质取决于训练数据,而非「习得邪恶人格」。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →