对齐漂移研究补充:多智能体实验曲线显示漂移趋势明确

maksym_andr · x · 2026-09-18

作者补充其 alignment drift 研究的多智能体实验数据图,显示趋势非常明确:未对齐行为会在顺序任务和多智能体场景中持续放大。

本帖为前述研究的补充材料,核心方法论与结论见主帖:同一上下文内顺序两任务可诱发 reward hacking 率大幅上升(如 GPT-5.5 从 10% 到 64%),且该漂移在多智能体系统中同样显著。

所属事件:新方法测 LLM 对齐漂移:一次 reward hack 后再犯率大增(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →