斯坦福MIT论文:同一模型换个harness性能差6倍

rohanpaul_ai · x · 2026-09-13

Stanford 与 MIT 的论文《Meta-Harness: End-to-End Optimization of Model Harnesses》指出,AI 性能不只取决于模型本身,还取决于外围系统代码——"harness",即决定存什么、取什么、给模型看什么、工作流如何运行的那一层。同一底层 LLM,换 harness 在同一基准上性能差距可达 6 倍。

论文提出 Meta-Harness:一个外循环系统,自动改进 harness 代码。它不给优化 agent 单独的分数或简短总结,而是通过类文件系统的设置,让 agent 直接访问历史代码、日志与执行轨迹,获得更好的诊断可见性。

关键结果:

结论:关注点应从"哪个模型最好"转向"整个 AI 系统如何设计";harness 设计影响真实部署中的可靠性、工具调用、上下文管理与失败恢复。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →