Quintin Pope 补充论证:LLM 对数据顺序鲁棒,后门行为本就难以被训练抹除

QuintinPope5 · x · 2026-09-29

Quintin Pope 在同一线程中补充:考虑到 LLM 训练对数据顺序表现出的鲁棒性,人们不得不得出「训练出的行为可以在前缀不精确重叠的情况下经受更多训练而存活」的结论。因为该研究「先在 x 前缀上训坏、再训好」的设置,与「同时在 x 上训坏、其余训好」并没有本质区别。

所属事件:研究者质疑灾难性遗忘能否抹除LLM后门坏行为(4 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →