ICML 论文 GRAM:用梯度路由模块精准切除 LLM 危险能力
burkov · x · 2026-07-30
一项研究提出了梯度路由辅助模块(GRAM),旨在解决大模型中危险知识(如生物武器制造)与有益知识(如疫苗研发)共存的安全难题。
核心机制
研究者在 Transformer 中加入小型辅助模块,这些模块的参数仅在训练特定类型的数据时更新,从而将专业知识「隔离」在可移除的模块中,而非扩散至整个网络。在推理时关闭该模块,即可在几乎不损害整体性能的前提下,精准削弱对应的危险能力。
实验验证
实验涵盖了病毒学、网络安全、核物理和特定代码领域,模型规模从 5000 万到 50 亿参数不等。结果表明,GRAM 在精确度上优于传统的数据过滤和模型遗忘方法。
「安全」频道最新
- AI 安全护栏引争议:研究者痛批「安全剧场」 — repligate · 2026-07-30
- Meta 智能眼镜偷拍泛滥,Instagram 官方出手封禁 — fortune · 2026-07-30
- Altman 赴华盛顿预览新模型,呼应前沿 AI 安全倡议 — imjustnewatai · 2026-07-30
- AI 公司能否外包安全?EU AI Act 对供应链的连锁反应 — sayashk · 2026-07-30
- 联合国秘书长警告 AI 发展超速,呼吁全球立法保护儿童 — ArtificialOther · 2026-07-30
- 成本不到4美元,AI即可精准定位匿名网友真实身份 — luisdans · 2026-07-30