Meta等新论文:分支化自优化让Agent Harness精度大增
rohanpaul_ai · x · 2026-10-04
Meta、杜克大学与加州大学的论文提出把 Agent Harness 的自优化搜索拆成多个专用分支:
- Harness 指 LLM 外围控制工具、检索与自检的代码;此前的 Meta-Harness 用固定题集迭代重写,容易陷入单一路径的局部最优。
- 新方法让每个分支保留自己更擅长解决的题目,并记录各自的「什么有效」笔记——数学任务中一个分支学会验证答案,另一个学会写完整推导。
- 部署时用 router 为每个任务选择最合适的分支头。
- 结果:在 Gemini 3 Flash 上,Olympiad 级数学准确率从 46.0% 升到 62.0%(相对提升 34.8%),Terminal-Bench 2.0 提升 11.6%,SWE-bench Lite 提升 3.8%,全部 4 项测试胜过 Meta-Harness。
实践启示:自动调优 agent 时,与其押注单一 harness,不如维护多个各有所长的专用 harness 并按任务路由。
所属事件:Meta等提出分支化自优化方法大幅提升Agent Harness性能(2 条相关)→
「编程与Agent」频道最新
- Meta 开源 RankEvolve:双 agent 互审把自动实验准确率从 45.8% 提到 62.5% — dair_ai · 2026-10-04
- CMU 论文用 RL 训练 4B 提案模型改 harness 代码,反超 35B 教师 — omarsar0 · 2026-10-04
- 开发者盛赞 pi-durable:让长时运行 Agent 嵌入任意界面 — tokumin · 2026-10-04
- Claude Code 2.1.289 提示词 tokens 涨 17.8%,系统提示占比过半 — ClaudeCodeLog · 2026-10-04
- Claude Code 2.1.289 修复权限绕过:@提及文件也受 deny 规则约束 — ClaudeCodeLog · 2026-10-04
- Claude Code 2.1.289 发布:新增 agent.spawn,修复 @提及权限绕过 — ClaudeCodeLog · 2026-10-04