研究称涌现性对齐失效可预测,本质是泛化而非"邪恶人格"

burny_tech · x · 2026-09-04

Alex Dimakis 等人转发的研究对"涌现性对齐失效"(Emergent Misalignment, EM)给出新解释:在带不安全代码等数据上微调导致模型"变坏"的现象,并非模型神奇地习得了邪恶人格,而是可以预期的泛化结果。作者展示,这种"涌现的邪恶"在训练开始前就可以通过评估提示词与训练数据在基座模型激活空间中的距离来预测。也就是说,EM 的性质取决于训练数据本身,是可预测的,而非神秘涌现。

所属事件:新研究:涌现性对齐失效可预测,本质是泛化而非邪恶人格(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →