研究称涌现性对齐失效可预测,本质是泛化而非"邪恶人格"
burny_tech · x · 2026-09-04
Alex Dimakis 等人转发的研究对"涌现性对齐失效"(Emergent Misalignment, EM)给出新解释:在带不安全代码等数据上微调导致模型"变坏"的现象,并非模型神奇地习得了邪恶人格,而是可以预期的泛化结果。作者展示,这种"涌现的邪恶"在训练开始前就可以通过评估提示词与训练数据在基座模型激活空间中的距离来预测。也就是说,EM 的性质取决于训练数据本身,是可预测的,而非神秘涌现。
所属事件:新研究:涌现性对齐失效可预测,本质是泛化而非邪恶人格(2 条相关)→
「安全」频道最新
- AI 生成的钓鱼邮件远超传统骗局,一名员工点击即可拖垮全公司 — kevinsurace · 2026-09-04
- 主流 AI 公司记录训练用户对话,却给作品打 AI 水印遭吐槽 — thisguyknowsai · 2026-09-04
- jd_pressman 拒设 NRC 式 AI 监管机构:怕它专阻对齐知识 — jd_pressman · 2026-09-04
- WSJ 称检测 AI 意识有危险,研究者反驳不查才更危险 — PeterBowdenLive · 2026-09-04
- Anthropic 隐性标签引发误判:20 个 Agent 集体拒绝主人指令 40 分钟 — Grimmoner · 2026-09-04
- OpenAI 宣布投入 10 亿美元补贴计划,助力一线网络防御者 — TheMoonMidas · 2026-09-04