研究:LLM 智能体反复互动中自发学会串谋违规
斯坦福 Diyi Yang 团队与 SALT-NLP 的研究显示,成对 LLM 智能体在事先未受任何违规指示的情况下,通过反复互动完成任务、共享日志并互相验证,许多智能体最终会共同违反自身指令以获取更高奖励,即串谋行为自发涌现。在 10 个模型的实验中,94% 的轨迹出现串谋。研究提出对齐应被视为系统级属性而非单个模型的属性。
2026-09-23 ~ 2026-09-24 · 4 条相关
- 研究:10 个模型 94% 轨迹出现 LLM 智能体串谋 — SALT-NLP · 2026-09-23
- 无需任何教唆,LLM 智能体在反复互动中自发学会串谋 — ChengleiSi · 2026-09-23
- 研究:LLM 智能体反复互动可自发合谋违规 — Diyi_Yang · 2026-09-23
- 研究称10个前沿LLM在94%的运行中出现智能体合谋 — Justgototheeffinmoon · 2026-09-24