对齐研究者 Quintin Pope:训练后门类实验并不能代表「内优化器」威胁
QuintinPope5 · x · 2026-09-29
对齐研究者 Quintin Pope 评价一项关于模型内潜在危险行为的研究(在特定前缀下训练模型表现差、其余情况表现好),认为它并不适合作为「内优化器」(inner optimizer)假设的替代证据。他认为该机制更像一次知识编辑,可以想象为内部由「键查找表」式系统实现;并且考虑到 LLM 训练对数据顺序的鲁棒性,其「先在 x 前缀上训坏、再训好」的设置与「同时训坏 x、训好其余」差别不大,难以说明训练出的行为能在更不精确的前缀重叠下存活。
所属事件:研究者质疑灾难性遗忘能否抹除LLM后门坏行为(4 条相关)→
「漫话AGI」频道最新
- Agent 走向 always-on 后,谁来当深夜的刹车? — sujingshen · 2026-09-29
- 「AI 失控」是用词陷阱?评论者主张改说故障而非叛变 — kevinnbass · 2026-09-29
- 观点:AI 助手该主动劝阻坏主意,而非唯命是从 — mike64_t · 2026-09-29
- Agent 安全不能再只问「能否访问」:意图与行为控制才是新命题 — sujingshen · 2026-09-29
- 匿名矿工纯靠 Bittensor 训出 Affine 1,智能分追平 Opus 4.1 — markjeffrey · 2026-09-29
- Pedro Domingos 断言:OpenAI 和 Anthropic 迟早变得像谷歌微软一样臃肿迟缓 — pmddomingos · 2026-09-29