Meta-Harness 论文:自动搜索 harness 代码,IMO 级数学提升 4.7 分
zainhas · x · 2026-09-14
arXiv 新论文 Meta-Harness(Chelsea Finn、Omar Khattab 等作者)提出用外循环系统自动优化 LLM 应用的 harness——即决定存取和呈现什么信息的代码,而非模型权重本身。系统用 agentic proposer 通过文件系统访问所有历史候选的源码、得分和执行轨迹来搜索新 harness。
结果:
- 在线文本分类上比 SOTA 上下文管理系统高 7.7 分,上下文 token 少 4 倍;
- 检索增强数学推理:单个发现的 harness 在 200 道 IMO 级题上,跨 5 个 held-out 模型平均提升 4.7 分;
- agentic coding 上超越 TerminalBench-2 最佳人工基线。
发帖人 zainhas 试用开源 agent 框架 goose 后感慨「开箱即用相当好」,并指出 harness 选择与优化里有大量 alpha。
所属事件:斯坦福MIT论文:同一模型换harness性能可差6倍(3 条相关)→
「编程与Agent」频道最新
- 开发者实测:其他模型无限扩需求,Grok Build 唯一能上线 — CedricMakes · 2026-09-15
- HYBRID 的 AI 教练四分之一对话出错却零告警,Amplitude 推 Agent Analytics 补盲区 — aakashgupta · 2026-09-15
- Crator 主打「ERP 版 Lovable」,年入千万美元企业已用它自建 ERP — Scobleizer · 2026-09-15
- 一次 agent 查询花掉 38 美元,作者反思模型混搭路由 — rseroter · 2026-09-15
- OpenAI 员工长文拆解:ChatGPT、Codex 与新 Agents API 如何分工 — TheMoonMidas · 2026-09-15
- 开源 Heimdall:纯 CPU 为 AI 编码智能体建跨仓库持久记忆 — Slight-Parfait3679 · 2026-09-15