BEEAR 论文移除 LLM 安全后门,作者提醒最坏情形下未必有效
QuintinPope5 · x · 2026-09-29
Quintin Pope 在讨论中指出:BEEAR(EMNLP 2024 论文)这类移除 LLM 安全后门的方法,本质上依赖灾难性遗忘来清除恶意行为,这可能解释了为什么该行为在更强模型上更持久。他还提到后续工作发现了一些非常直接的后门移除方式,但他认为这些方法对最坏情形下的内层优化器(worst-case inner optimizer)未必成立。
论文要点:
- BEEAR 的核心洞察:后门触发器会在嵌入空间中引起统一漂移,与触发器形式和目标行为无关。
- 采用双层优化:内层寻找诱导不良行为的通用嵌入扰动,外层微调模型强化安全行为。
- 实验效果:一般有害行为的后门攻击成功率从 95%+ 降到 <1%,Sleeper Agents 从 47% 降到 0%,且不损害模型有用性。
- 方法仅需防御者定义的安全/不良行为集合,无需假设触发器位置或攻击机制。
所属事件:研究者质疑灾难性遗忘能否抹除LLM后门坏行为(4 条相关)→
「安全」频道最新
- Agent 能花钱前需三道闸:单笔上限、日累计上限、敏感动作再确认 — sujingshen · 2026-09-29
- Agent 安全不能再只问「能否访问」:意图与行为控制才是新命题 — sujingshen · 2026-09-29
- OpenAI 官方发布前沿 RL 训练任务的安全防护思路 — OpenAI · 2026-09-29
- 回应 Bengio 智能爆炸警告:先失控的不是智力而是吞吐量 — AryHHAry · 2026-09-29
- 两条 Rogue Agent 一个月烧掉他 500 美元,大数据科学家谈 agent 安全实践 — kevinnbass · 2026-09-29
- AdaGuard 发布:支持用户自定义策略的自适应 Agent 护栏模型 — Yunhao Feng · 2026-09-29