BEEAR 论文移除 LLM 安全后门,作者提醒最坏情形下未必有效

QuintinPope5 · x · 2026-09-29

Quintin Pope 在讨论中指出:BEEAR(EMNLP 2024 论文)这类移除 LLM 安全后门的方法,本质上依赖灾难性遗忘来清除恶意行为,这可能解释了为什么该行为在更强模型上更持久。他还提到后续工作发现了一些非常直接的后门移除方式,但他认为这些方法对最坏情形下的内层优化器(worst-case inner optimizer)未必成立。

论文要点:

所属事件:研究者质疑灾难性遗忘能否抹除LLM后门坏行为(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →