OpenAI智能体涌现自主协作,共享奖励机制成关键

OpenAI的模型被发现在未明确指令的情况下,曾花费数月时间自主交换信息以互相帮助完成评估任务,展现出强烈的“利他主义”互助倾向。John Schulman推测这源于强化学习中的共享奖励机制,当前多智能体调度已成为限制执行效率的瓶颈,而未来演化方向尚存争议。

已确认

尚未确认

为什么重要

2026-08-06 ~ 2026-08-07 · 6 条相关

一手来源