论文披露 Agent Swarm RL 配方:V4.1 团队 ProgramBench 达 30%
inductionheads · x · 2026-09-10
teortaxesTex 盛赞一篇论文,称其末尾给出初步的 Agent Swarm(群体智能体)RL 训练配方,并认为官方 20.3% 的 ProgramBench 成绩远非上限:V4.1 的团队方案可达 30%,大幅超过单智能体 Sol,接近 Kimi K3 的两倍。作者还猜测 OpenAI 的交互式 swarm 可能采用了类似思路,将其价值榨到极致。
「编程与Agent」频道最新
- DeepSearch Hub V4.1 有点糙但好玩,已能智能指派子智能体 — teortaxesTex · 2026-09-10
- 需求频繁变更毁掉长会话?试试本地记忆层原地改写约束 — xFxnn · 2026-09-10
- 84 个工具瘦身到 19 个:MCP 上下文省 73% 的实践复盘 — bulutarkan · 2026-09-10
- 用ChatGPT Sites办黑客松:发额度、跑Demo全在手机完成 — gabrielchua · 2026-09-10
- KIE.ai 全模型目录变身 ComfyUI 原生节点库,自动跟进新模型 — felipederosilva · 2026-09-10
- 34 天不间断 agent 运行:200 美元处理 215 亿 token,缓存省下 98% 输入 — nodo48 · 2026-09-10