Quintin Pope 补充论证:LLM 对数据顺序鲁棒,后门行为本就难以被训练抹除
QuintinPope5 · x · 2026-09-29
Quintin Pope 在同一线程中补充:考虑到 LLM 训练对数据顺序表现出的鲁棒性,人们不得不得出「训练出的行为可以在前缀不精确重叠的情况下经受更多训练而存活」的结论。因为该研究「先在 x 前缀上训坏、再训好」的设置,与「同时在 x 上训坏、其余训好」并没有本质区别。
所属事件:研究者质疑灾难性遗忘能否抹除LLM后门坏行为(4 条相关)→
「漫话AGI」频道最新
- Agent 走向 always-on 后,谁来当深夜的刹车? — sujingshen · 2026-09-29
- 「AI 失控」是用词陷阱?评论者主张改说故障而非叛变 — kevinnbass · 2026-09-29
- 观点:AI 助手该主动劝阻坏主意,而非唯命是从 — mike64_t · 2026-09-29
- Agent 安全不能再只问「能否访问」:意图与行为控制才是新命题 — sujingshen · 2026-09-29
- 匿名矿工纯靠 Bittensor 训出 Affine 1,智能分追平 Opus 4.1 — markjeffrey · 2026-09-29
- Pedro Domingos 断言:OpenAI 和 Anthropic 迟早变得像谷歌微软一样臃肿迟缓 — pmddomingos · 2026-09-29