研究挑战 Emergent Misalignment:模型「邪恶」可在训练前预测
ChenhaoTan · x · 2026-09-04
新研究指出,在 insecure code 上微调会诱发 LLM 的 Emergent Misalignment(EM,「统治世界」等意外行为),但这并非神秘涌现——而是可预期的泛化:通过在基座模型激活空间中度量评测提示与训练数据的距离,可以在训练之前就高度准确地预测这种「邪恶」是否会出现。其性质取决于训练数据,而非「习得邪恶人格」。
「安全」频道最新
- 独家:扎克伯格私下致电特朗普,反对设立国家 AI 监管机构 — GarrisonLovely · 2026-09-04
- OpenAI 判定 GPT-6 Astra 具备「Critical」级网络攻击能力 — SIGKITTEN · 2026-09-04
- Zvi 警告:Astra 思维链可控性大增,可监控性堪忧 — TheZvi · 2026-09-04
- 求推荐:能拦截恶意 prompt 的最小聊天模型怎么选? — Brilliant_Criticism3 · 2026-09-04
- Debian 通过全体决议规范 LLM 使用,反对 Haiku 式全面禁 AI 代码 — unixterminal · 2026-09-04
- 新模型发布后谁更受益:攻击者还是防御者?博客探讨 AI 安全不对称 — aminkarbasi · 2026-09-04