苹果论文:单 Agent 加 Shell 胜过多 Agent 编排,Kaggle 奖牌率 62.5% 对 47.1%
rohanpaul_ai · x · 2026-10-07
苹果论文《How Much of a Harness Does a Strong Agent Need for Autonomous ML Engineering?》系统评估了自动化 ML 工程中的 agent 编排框架,结论是进步主要来自模型与运行时本身,而非外层脚手架。
- 在同一代码库、同一模型、同一硬件和 24 小时预算下重跑多个封装框架,唯一明确有效的改动是给模型一个 shell 和文件访问,而非聊天框
- 一个精心写 prompt 的单会话 agent 打平或胜过 4 个多 agent ML 系统;用 GLM 5.2 时,极简 agent 在 62.5% 的 Kaggle 任务上获奖牌,超过最佳公开 harness 的 47.1%
- 并行多 agent 和消息通道反而把奖牌率从 55.7% 拉低到 33.3%
- 作者认为搜索树、记忆层、专家 agent 团队等设计源于模型还只能写代码不能跑代码的时代,建议先从单会话起步
「编程与Agent」频道最新
- Theo 重写 tsc:烧 40 万美元 Codex 无果,Opus 两周搞定 — dejavucoder · 2026-10-07
- LLM 缺乏「幂等性」:复查自己的大代码库会自相矛盾 — StephanSturges · 2026-10-07
- 开源 Skill「播客转文章」:换轴成文,砍掉 35% 还零信息损失 — oran_ge · 2026-10-07
- supermemory 重构 API:为 Agent 而非人类设计接口的实战复盘 — blaizedsouza · 2026-10-07
- Epic 开源原生多进程图形调试器 raddebugger,星数破 7700 — EpicGames · 2026-10-07
- 开源终端 cmux 专为 AI 编程 Agent 设计,星数近 2.8 万 — manaflow-ai · 2026-10-07