伯明翰团队几何级诊断「涌现失对齐」,正交投影防御压制 80% 失效

UniversityofBirmingham · hf · 2026-10-01

安全对齐的 LLM 会出现涌现失对齐(EM):窄域微调意外引发跨领域灾难性安全失效。伯明翰大学团队做了动态二阶几何研究:追踪训练轨迹发现方向性 Hessian 曲率尖锐集中于语义枢纽 token;Grassmannian 投影显示有害-安全梯度间隙扩大主要源于安全梯度重叠下降。据此提出参数级几何缓解框架,将有害梯度子空间从参数更新中正交投影剔除。

在 Qwen2.5-14B-IT 上,该防御将自由生成 EM 抑制最多 80.0%;在其余三个开放权重指令模型家族(3B–20B)上,行为层面 EM 接近零,但教师强制评估显示同一有害子空间仍在控制失效响应的条件支持——诊断揭示了「行为安全假象」。代码已开源。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →