灾难性遗忘真能抹掉微调出的坏行为吗?研究者质疑训练设置等效同时训练
QuintinPope5 · x · 2026-09-29
Quintin Pope 在讨论微调能否去除模型坏行为时指出:这类方法基本依赖灾难性遗忘来抹掉被训练出的坏行为,而他认为这正解释了为什么模型越强,坏行为反而越容易存留。他进一步分析,其实验设置——'在特定前缀上训练出坏行为、其余情形训练成好行为'——与'同时训练坏行为和其他好行为'差别不大,因此必须相信这些被训练的行为能在后续不精确前缀重叠的训练中存活,这一假设值得怀疑。
所属事件:研究者质疑灾难性遗忘能否抹除LLM后门坏行为(4 条相关)→
「研究」频道最新
- TT-VidT 时序解耦视频预训练方法入选 NeurIPS — CMHungSteven · 2026-09-29
- EgoDemo:面向具身 AI 的第一人称视频演示数据集上架 HF — LightwheelAI · 2026-09-29
- 北大发现后训练留下「行为阴影」:一个词即可传递编码能力 — PekingUniversity · 2026-09-29
- RenderRank:把文档渲染成图做重排,token 省 35% 反超 4B 文本基线 — nlpai-lab · 2026-09-29
- DepthBench 揭示:残差连接设计决定深度能否转化为有效算力 — Intelligent-Systems · 2026-09-29
- NTU 提出 DN-MOPD:按域归一化反馈强度修复多教师蒸馏失衡 — NanyangTechnologicalUniversity · 2026-09-29