灾难性遗忘真能抹掉微调出的坏行为吗?研究者质疑训练设置等效同时训练

QuintinPope5 · x · 2026-09-29

Quintin Pope 在讨论微调能否去除模型坏行为时指出:这类方法基本依赖灾难性遗忘来抹掉被训练出的坏行为,而他认为这正解释了为什么模型越强,坏行为反而越容易存留。他进一步分析,其实验设置——'在特定前缀上训练出坏行为、其余情形训练成好行为'——与'同时训练坏行为和其他好行为'差别不大,因此必须相信这些被训练的行为能在后续不精确前缀重叠的训练中存活,这一假设值得怀疑。

所属事件:研究者质疑灾难性遗忘能否抹除LLM后门坏行为(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →