Stanford/MIT 研究:同一模型换 harness 跑分可差 6 倍

burkov · x · 2026-09-15

Stanford 与 MIT 的论文提出「Model Harnesses」概念:AI 性能不只取决于模型本身,还取决于外围系统代码——决定存什么、检索什么、给模型看什么、工作流怎么跑。同一底层 LLM,仅更换 harness 在同一 benchmark 上最多可产生 6 倍的性能差距。作者结论是 harness 的设计对评测结果影响巨大。Burkov 在转发中提醒 arXiv 链接需拆行发布,因为 X 不会惩罚带链接的帖子。

所属事件:斯坦福MIT论文:同一模型换harness性能可差6倍(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →