Stanford/MIT 研究:同一模型换 harness 跑分可差 6 倍
burkov · x · 2026-09-15
Stanford 与 MIT 的论文提出「Model Harnesses」概念:AI 性能不只取决于模型本身,还取决于外围系统代码——决定存什么、检索什么、给模型看什么、工作流怎么跑。同一底层 LLM,仅更换 harness 在同一 benchmark 上最多可产生 6 倍的性能差距。作者结论是 harness 的设计对评测结果影响巨大。Burkov 在转发中提醒 arXiv 链接需拆行发布,因为 X 不会惩罚带链接的帖子。
所属事件:斯坦福MIT论文:同一模型换harness性能可差6倍(3 条相关)→
「研究」频道最新
- 递归循环 Transformer 实现无限推理深度,代码开源 — 141_1337 · 2026-09-15
- arXiv 拟推「口试」审查?学者热议 AI 代写投稿乱象 — RishiBommasani · 2026-09-15
- Jay Alammar PyData 演讲:读懂 agent 基准分数的十个关键问题 — JayAlammar · 2026-09-15
- RLE-Bench 出炉:48 项任务评测 LLM 机器人工程能力不止于控制 — daibond_alpha · 2026-09-15
- BrainGPT 作者:AI 科学发现将复杂到「像对狗讲量子力学」 — every · 2026-09-15
- Ethan Mollick 用 GPT 试译线形文字A,自嘲那是 researchslop — emollick · 2026-09-15