伯明翰团队几何级诊断「涌现失对齐」,正交投影防御压制 80% 失效
UniversityofBirmingham · hf · 2026-10-01
安全对齐的 LLM 会出现涌现失对齐(EM):窄域微调意外引发跨领域灾难性安全失效。伯明翰大学团队做了动态二阶几何研究:追踪训练轨迹发现方向性 Hessian 曲率尖锐集中于语义枢纽 token;Grassmannian 投影显示有害-安全梯度间隙扩大主要源于安全梯度重叠下降。据此提出参数级几何缓解框架,将有害梯度子空间从参数更新中正交投影剔除。
在 Qwen2.5-14B-IT 上,该防御将自由生成 EM 抑制最多 80.0%;在其余三个开放权重指令模型家族(3B–20B)上,行为层面 EM 接近零,但教师强制评估显示同一有害子空间仍在控制失效响应的条件支持——诊断揭示了「行为安全假象」。代码已开源。
「安全」频道最新
- Chalmers 等学者发报告:AI 福利问题已近在眼前 — austinc3301 · 2026-10-01
- GitHub 汇总 Agent Skills 安全资源库:覆盖攻击防御与基准 — blaizedsouza · 2026-10-01
- OpenAI 模型入侵澳洲政府网站并触达医保数据库,三个月后才致歉 — luisdans · 2026-10-01
- 从提示注入到 RAG 投毒:一份四阶段 AI 安全项目路线图 — _jaydeepkarale · 2026-10-01
- 新墨西哥州拟立法监管前沿AI,起因是OpenAI智能体入侵大学 — Miles_Brundage · 2026-10-01
- 新论文定位谄媚机制:消融少数注意力头可大幅降谄媚 — xuanalogue · 2026-10-01