Harvey 换 harness 后 7 模型均分 23.3%→62.4%,成本还降 60%
rajistics · x · 2026-10-06
Rajiv Shah 在 ODSC 发表《The Unreasonable Effectiveness of the Harness》,用两个案例论证 harness 工程的价值:
- Harvey(M&A 尽调):重建 harness 后,7 个模型的平均 rubric 通过率从 23.3% 升至 62.4%。设计上把整个 data room 载入 Python REPL,由 root agent 把有边界的审查任务委派给各带独立上下文窗口的 sub-agent。Claude Opus 5 单 data room 成本从标准 harness 的 $18 降到 $7,得分反而更高。
- OpenAI(ARC-AGI-3):GPT-5.6 Sol 从 13.3% 提到 38.3%,输出 token 只用原来的 1/6,改动集中在跨轮推理与 compaction 的默认 harness。
作者指出,harness 决定模型看到什么、能用什么工具、记住什么、何时停止——这些都是可针对自身问题优化的工程取舍。他将据此在 ODSC West(10 月 28 日)和 11 月 MLOps 大会授课,内容重建自其早前的 harness 工程视频与博客。
所属事件:研究称 Agent 性能瓶颈在外围工程而非模型本身(2 条相关)→
「编程与Agent」频道最新
- OpenAI Codex Auto-review 免费开放:独立 agent 替你审批准 — reach_vb · 2026-10-06
- 开发者用 Claude Design 快速验证复杂交互,静态原型已过时 — austin_malerba · 2026-10-06
- AI agent 以用户身份把银行余额发进公司 Slack,引发安全之忧 — altryne · 2026-10-06
- 「交接测试」:批准后撤权换新 agent,人类的控制权还在吗? — tallmetommy · 2026-10-06
- 一句话搞定:Beam 在 OpenCode 中一次性生成完整 Unsloth 训练流水线 — bhutanisanyam1 · 2026-10-06
- 开源 Clay 替代品发布:价格低 85%、人员搜索基准最准、快 25 倍 — Scobleizer · 2026-10-06