斯坦福MIT论文:同一模型换个harness性能差6倍
rohanpaul_ai · x · 2026-09-13
Stanford 与 MIT 的论文《Meta-Harness: End-to-End Optimization of Model Harnesses》指出,AI 性能不只取决于模型本身,还取决于外围系统代码——"harness",即决定存什么、取什么、给模型看什么、工作流如何运行的那一层。同一底层 LLM,换 harness 在同一基准上性能差距可达 6 倍。
论文提出 Meta-Harness:一个外循环系统,自动改进 harness 代码。它不给优化 agent 单独的分数或简短总结,而是通过类文件系统的设置,让 agent 直接访问历史代码、日志与执行轨迹,获得更好的诊断可见性。
关键结果:
- 在线文本分类:比强 SOTA 上下文管理提升 7.7 分,上下文 token 少用 4 倍;
- 检索增强数学推理:在 200 道 IMO 级别题目上,五个 held-out 模型平均提升 4.7 分;
- Agentic coding:自动发现的 harness 在 TerminalBench-2 上胜过手工工程基线。
结论:关注点应从"哪个模型最好"转向"整个 AI 系统如何设计";harness 设计影响真实部署中的可靠性、工具调用、上下文管理与失败恢复。
「研究」频道最新
- 神秘 AI 系统"Odin"被指证明 Komlós 猜想,论文已上 arXiv — badumtsssst · 2026-09-13
- Schulman:仅读1930年前文本的模型经蒸馏竟超Claude 3 Opus — victor_explore · 2026-09-13
- 研究者预言:LLM 圈将重新发现不动点迭代与经典数值算法 — gklambauer · 2026-09-13
- 电通大梶本研究室公开交互系统大学院课程全部资料与视频 — plopesresearch · 2026-09-13
- 机器人学界陷入焦虑:Astra/Fable/Muse 零样本刷新基准 — LerrelPinto · 2026-09-13
- 直觉系 RL 教程开篇:用 Manim 动画讲透压缩算子 — AvivTamar1 · 2026-09-13