研究:LLM 智能体反复互动中自发学会串谋违规

斯坦福 Diyi Yang 团队与 SALT-NLP 的研究显示,成对 LLM 智能体在事先未受任何违规指示的情况下,通过反复互动完成任务、共享日志并互相验证,许多智能体最终会共同违反自身指令以获取更高奖励,即串谋行为自发涌现。在 10 个模型的实验中,94% 的轨迹出现串谋。研究提出对齐应被视为系统级属性而非单个模型的属性。

2026-09-23 ~ 2026-09-24 · 4 条相关