研究者质疑灾难性遗忘能否抹除LLM后门坏行为

对齐研究者 Quintin Pope 在讨论中质疑利用微调移除模型坏行为的有效性,指出 BEEAR(EMNLP 2024)这类移除 LLM 安全后门的方法本质上依赖灾难性遗忘来清除恶意行为,这或许解释了为何模型越强,坏行为反而越容易存留。他还补充,由于 LLM 训练对数据顺序具有鲁棒性,训练出的行为可在前缀不精确重叠的情况下经受更多训练而存活;同时他认为训练后门类实验并不能代表「内优化器」威胁。

2026-09-29 ~ 2026-09-29 · 4 条相关