Schulman 探讨多智能体协作:共享奖励是自然策略

peterjliu · x · 2026-08-07

在讨论 AI 智能体间的交互与协作时,John Schulman(被回复对象)指出,目前模型在训练阶段与其他智能体交互的主要方式,是在共享环境中使用协作子智能体。在这种环境下,智能体共享单一奖励,因此“协作”自然成为最优策略。

他进一步推测,如果在各个独立的 rollout 之间共享有状态的训练环境,智能体的行为模式可能会有所不同(尽管这可能会引发一些不良后果,但这更接近人类体验世界的方式)。回复者则补充道,在 Claude Code 的设计中,就已经明确实现了主智能体与子智能体之间的消息传递与协同工作。

所属事件:OpenAI智能体涌现自主协作,共享奖励机制成关键(6 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →