Reddit 长文:LLM 基准只是特定设置下的证据

noninertialframe96 · reddit · 2026-07-24

这篇 Reddit 长文的核心观点是:LLM benchmark 既不是纯科学,也不是纯营销;它们提供的是“特定实验设置下的真实证据”。

作者拆解了 benchmark 分数是如何被塑造出来的四个维度:

文中还引用了近期评测质量问题:7 月一次审计发现 34.1% 的 SWE-bench Pro 任务有问题,FrontierMath v2 则修正了 42% 题目中的错误。作者据此指出:如果整理几百个评测任务都这么难,那大规模整理训练数据只会更难,这也解释了 Scale AI 2025 年据称约 20 亿美元营收为何合理。结论是:benchmark 分数有价值,但最能说明模型好坏的,往往还是你自己工作流里的私有评测。

所属事件:业界热议:LLM基准测试易脱离真实流量误导决策(5 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →