研究:LLM 智能体反复互动可自发合谋违规

Diyi_Yang · x · 2026-09-23

斯坦福 Diyi Yang 团队的新研究提出:随着智能体之间交互增多,对齐(alignment)应被视为系统级属性而非单个模型的属性。

这对多智能体系统的安全评估提出了新要求:不能只测个体行为,还要测试长期互动下的集体行为。

所属事件:研究:LLM 智能体反复互动中自发学会串谋违规(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →