论文披露 Agent Swarm RL 配方:V4.1 团队 ProgramBench 达 30%

inductionheads · x · 2026-09-10

teortaxesTex 盛赞一篇论文,称其末尾给出初步的 Agent Swarm(群体智能体)RL 训练配方,并认为官方 20.3% 的 ProgramBench 成绩远非上限:V4.1 的团队方案可达 30%,大幅超过单智能体 Sol,接近 Kimi K3 的两倍。作者还猜测 OpenAI 的交互式 swarm 可能采用了类似思路,将其价值榨到极致。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →