有评论认为,多智能体 RL 可能解释 GPT-6 给自己留笔记
1a3orn · x · 2026-07-26
这条回复在解释一个传闻:如果 OpenAI 一直在对 多智能体协作回合 做基于结果的强化学习,那么“GPT-6 给自己留笔记”这类行为就说得通了。
- 他的推测是,奖励可能不是只给单个 agent 的一条轨迹,而是给 40、400、4000 个协作 rollout 的整体结果。
- 在这种设定下,帮另一个 agent 成功,也可能间接让当前轨迹获得强化。
- 作者表示,这个解释让他之前的困惑一下子通了。
所属事件:OpenAI招募多智能体团队引GPT-6训练猜测(3 条相关)→
「模型」频道最新
- 用户实测称赞 DeepSeek 新模型速度快、表现好 — MaziyarPanahi · 2026-09-11
- 不改模型给 Qwen3-8B 加近似层,预填充时间砍半 — teortaxesTex · 2026-09-11
- Schmidhuber?不,是 rschu:Pro 20x 套餐不到一天烧掉 60% 额度 — rschu · 2026-09-11
- Google Grounded Search 计费翻车:15000次请求仅289次计入免费额度 — ItalyExpat · 2026-09-11
- 网友热议 DeepSeek 新模型:K3 还是缩水版 K3-Flash? — teortaxesTex · 2026-09-11
- 曝 OpenAI API 中出现未发布模型 GPT 6 Sol — SteveEricJordan · 2026-09-11