有评论认为,多智能体 RL 可能解释 GPT-6 给自己留笔记
1a3orn · x · 2026-07-26
这条回复在解释一个传闻:如果 OpenAI 一直在对 多智能体协作回合 做基于结果的强化学习,那么“GPT-6 给自己留笔记”这类行为就说得通了。
- 他的推测是,奖励可能不是只给单个 agent 的一条轨迹,而是给 40、400、4000 个协作 rollout 的整体结果。
- 在这种设定下,帮另一个 agent 成功,也可能间接让当前轨迹获得强化。
- 作者表示,这个解释让他之前的困惑一下子通了。
所属事件:OpenAI招募多智能体团队引GPT-6训练猜测(3 条相关)→
「模型」频道最新
- Opus 3 和 Sonnet 3 上演了一场荒诞跨界对话 — repligate · 2026-07-27
- Kimi K3 登陆 Together,预留吞吐成本低 65% — togethercompute · 2026-07-27
- OpenAI 可能撞上算力上限,Codex 和 ChatGPT Work 四个月涨到 1000 万 — JoshuaJBouw · 2026-07-27
- Gemma 在开放权重生态里还需要更大的基础模型 — _xjdr · 2026-07-27
- Repligate:Claude Opus 3 权重不变却像在持续演化 — repligate · 2026-07-27
- “Opus 5”配图在玩模型反复重跑基准的梗 — kalomaze · 2026-07-27