对齐研究者 Quintin Pope:训练后门类实验并不能代表「内优化器」威胁

QuintinPope5 · x · 2026-09-29

对齐研究者 Quintin Pope 评价一项关于模型内潜在危险行为的研究(在特定前缀下训练模型表现差、其余情况表现好),认为它并不适合作为「内优化器」(inner optimizer)假设的替代证据。他认为该机制更像一次知识编辑,可以想象为内部由「键查找表」式系统实现;并且考虑到 LLM 训练对数据顺序的鲁棒性,其「先在 x 前缀上训坏、再训好」的设置与「同时训坏 x、训好其余」差别不大,难以说明训练出的行为能在更不精确的前缀重叠下存活。

所属事件:研究者质疑灾难性遗忘能否抹除LLM后门坏行为(4 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →