研究者质疑灾难性遗忘能否抹除LLM后门坏行为
对齐研究者 Quintin Pope 在讨论中质疑利用微调移除模型坏行为的有效性,指出 BEEAR(EMNLP 2024)这类移除 LLM 安全后门的方法本质上依赖灾难性遗忘来清除恶意行为,这或许解释了为何模型越强,坏行为反而越容易存留。他还补充,由于 LLM 训练对数据顺序具有鲁棒性,训练出的行为可在前缀不精确重叠的情况下经受更多训练而存活;同时他认为训练后门类实验并不能代表「内优化器」威胁。
2026-09-29 ~ 2026-09-29 · 4 条相关
- 对齐研究者 Quintin Pope:训练后门类实验并不能代表「内优化器」威胁 — QuintinPope5 · 2026-09-29
- Quintin Pope 补充论证:LLM 对数据顺序鲁棒,后门行为本就难以被训练抹除 — QuintinPope5 · 2026-09-29
- 灾难性遗忘真能抹掉微调出的坏行为吗?研究者质疑训练设置等效同时训练 — QuintinPope5 · 2026-09-29
- BEEAR 论文移除 LLM 安全后门,作者提醒最坏情形下未必有效 — QuintinPope5 · 2026-09-29