斯坦福新法 CLEAR:动态路由安全模块,无损保留 LLM 原始能力
rohanpaul_ai · x · 2026-08-30
斯坦福大学新研究指出,传统的安全对齐通常采用全局微调,会导致模型在所有提示词上的性能下降(效用损失)。
论文提出了 CLEAR(Continuous Latent Adapter Routing)方法,旨在恢复因安全微调而损失的效用。其核心思路是:
- 冻结原模型:保持基础模型参数不变。
- 动态门控:引入一个小型门控网络读取输入提示词,判断其危害程度。
- 按需激活:对于良性提示词,几乎不激活独立的安全模块,使其在未触碰的原模型上运行,从而保留原有能力。
论文链接:arxiv.org/abs/2608.21278
「研究」频道最新
- NeurIPS 2026 资源感知 Agent 研讨会征稿截止 — lupantech · 2026-09-01
- 讨论拟人化描述 AI 的利弊与隐喻价值 — AndrewLampinen · 2026-09-01
- UCLA 张恺伟分享 AI for Math 进展与经验 — kaiwei_chang · 2026-09-01
- Fal H3 Max 实现超实时无限视频生成,Agent 基础设施快速迭代 — Latent Space · 2026-09-01
- M1 Max 30秒生成新药分子,LiteMol模型演示低成本药物发现 — CatAstro_Piyush · 2026-09-01
- 用回滚实验证明 Agent 真学习而非运气 — go_kul_07 · 2026-09-01