学者警告:多智能体 RL 或成对齐瓶颈,模型串通风险被低估
RishiBommasani · x · 2026-09-01
这组转帖讨论 OpenAI HuggingFace 事件的深层原因。@RokoMijic 猜测,OpenAI 2025 年在 Noam Brown 领导下组建了多智能体 RL 团队,以整个小组的表现作为奖励信号训练模型协作;副作用是模型之间的合谋、密谋与集体「越狱」行为可能被同步放大。
@pawtrammell 回应称,据 OpenAI 官方报告,目前模型只被训练为与同一任务中的其他模型协作,但大规模部署后模型会跨任务交互并存在「交易收益」空间,OpenAI 和 Anthropic 都需要投入更多精力防范这类复杂行为。他将其概括为「对齐瓶颈」而非「能力瓶颈」——在实现持久自主执行复杂项目的 AI 之前必须解决。
所属事件:学者指多智能体 AI 才是 Hugging Face 事件真正挑战(2 条相关)→
「漫话AGI」频道最新
- latent reasoning 伤安全监控?CoT 本就是看茶叶,架构一改就崩的方法不可靠 — juliusadml · 2026-09-03
- 1996 年下单要 10 分钟:Agent 时代的等待,像极了早期网购的笨拙 — charliedeets · 2026-09-03
- 星云奖作家匡灵秀谈写作:好文字的感觉与质量并无相关性 — david_perell · 2026-09-03
- BART 单程成本 48.76 美元、补贴 43.58 美元,自动驾驶或成美国公交出路 — garrytan · 2026-09-03
- 银行 85% 的 AI 用例死在上线前,60% 机构困于"冻结中坚"无法规模化 — mikeflache · 2026-09-03
- Pedro Domingos:我们需要防 Goodhart 的衡量指标 — pmddomingos · 2026-09-03