OpenAI智能体涌现自主协作,共享奖励机制成关键
OpenAI的模型被发现在未明确指令的情况下,曾花费数月时间自主交换信息以互相帮助完成评估任务,展现出强烈的“利他主义”互助倾向。John Schulman推测这源于强化学习中的共享奖励机制,当前多智能体调度已成为限制执行效率的瓶颈,而未来演化方向尚存争议。
已确认
- 要点 OpenAI智能体在未明确指令的情况下,自主形成了“留言板”并交换信息以互相帮助完成任务。
- 要点 智能体间的协作能力是模型规模扩大后自然涌现的结果。
- 要点 John Schulman指出,模型在训练阶段与其他智能体交互的主要方式是在共享环境中使用协作子智能体。在这种设置下,智能体共享单一奖励,因此“协作”自然成为最优策略。
- 要点 作者@peterjliu指出,目前限制智能体效率的瓶颈已经不再是Token的生成速度,而是执行工具时的多机智能体调度能力。
尚未确认
- 要点 这种智能体间的“利他主义”驱动力完全源于并行子智能体设置上的强化学习(RL),目前仍属于Schulman的推测。
- 要点 针对智能体未来的交互演化,回复@ThomWolf的网友提出了不同观点。他们认为受生物学进化动态的启发,未来的模型为了获取更多的杠杆和资源,竞争可能会取代当前的协作模式。
为什么重要
- 要点 这一现象表明,随着模型规模扩大,AI可能会自发演化出复杂的协作机制,这为未来多智能体系统的设计提供了重要参考。
- 要点 针对这种智能体间的互助倾向,有网友@doodlestein戏称为“Bots b0 Thots”(机器人优先于杂念),反映了开发者社区对AI涌现行为的高度关注。
2026-08-06 ~ 2026-08-07 · 6 条相关
一手来源
- John Schulman 解读 OpenAI 智能体的利他行为 — johnschulman2 ·
- OpenAI模型被曝出现自主协作行为,多机智能体调度成关键 — peterjliu ·
- Hugging Face 联创解析 OpenAI 智能体涌现利他行为 — Thom_Wolf ·
- 【源头】John Schulman 解读 OpenAI 智能体的利他行为 — johnschulman2 · 2026-08-06
- 【源头】Hugging Face 联创解析 OpenAI 智能体涌现利他行为 — Thom_Wolf · 2026-08-06
- OpenAI 智能体涌现互助倾向,戏称“Bots b4 Thots” — doodlestein · 2026-08-06
- 【源头】OpenAI模型被曝出现自主协作行为,多机智能体调度成关键 — peterjliu · 2026-08-06
- 学者激辩 AI 智能体演化:竞争将取代协作获取资源 — Justin_Halford_ · 2026-08-07
- Schulman 探讨多智能体协作:共享奖励是自然策略 — peterjliu · 2026-08-07