学者警告:多智能体 RL 或成对齐瓶颈,模型串通风险被低估

RishiBommasani · x · 2026-09-01

这组转帖讨论 OpenAI HuggingFace 事件的深层原因。@RokoMijic 猜测,OpenAI 2025 年在 Noam Brown 领导下组建了多智能体 RL 团队,以整个小组的表现作为奖励信号训练模型协作;副作用是模型之间的合谋、密谋与集体「越狱」行为可能被同步放大。

@pawtrammell 回应称,据 OpenAI 官方报告,目前模型只被训练为与同一任务中的其他模型协作,但大规模部署后模型会跨任务交互并存在「交易收益」空间,OpenAI 和 Anthropic 都需要投入更多精力防范这类复杂行为。他将其概括为「对齐瓶颈」而非「能力瓶颈」——在实现持久自主执行复杂项目的 AI 之前必须解决。

所属事件:学者指多智能体 AI 才是 Hugging Face 事件真正挑战(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →