斯坦福新法 CLEAR:动态路由安全模块,无损保留 LLM 原始能力

rohanpaul_ai · x · 2026-08-30

斯坦福大学新研究指出,传统的安全对齐通常采用全局微调,会导致模型在所有提示词上的性能下降(效用损失)。

论文提出了 CLEAR(Continuous Latent Adapter Routing)方法,旨在恢复因安全微调而损失的效用。其核心思路是:

论文链接:arxiv.org/abs/2608.21278

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →