ICML 论文 GRAM:用梯度路由模块精准切除 LLM 危险能力

burkov · x · 2026-07-30

一项研究提出了梯度路由辅助模块(GRAM),旨在解决大模型中危险知识(如生物武器制造)与有益知识(如疫苗研发)共存的安全难题。

核心机制

研究者在 Transformer 中加入小型辅助模块,这些模块的参数仅在训练特定类型的数据时更新,从而将专业知识「隔离」在可移除的模块中,而非扩散至整个网络。在推理时关闭该模块,即可在几乎不损害整体性能的前提下,精准削弱对应的危险能力。

实验验证

实验涵盖了病毒学、网络安全、核物理和特定代码领域,模型规模从 5000 万到 50 亿参数不等。结果表明,GRAM 在精确度上优于传统的数据过滤和模型遗忘方法。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →