Reddit 长文:LLM 基准只是特定设置下的证据
noninertialframe96 · reddit · 2026-07-24
这篇 Reddit 长文的核心观点是:LLM benchmark 既不是纯科学,也不是纯营销;它们提供的是“特定实验设置下的真实证据”。
作者拆解了 benchmark 分数是如何被塑造出来的四个维度:
- 选哪些任务进入榜单;
- 用什么 harness 和算力预算跑;
- 采用什么评分方式;
- 实验室最终报告哪一个结果。
文中还引用了近期评测质量问题:7 月一次审计发现 34.1% 的 SWE-bench Pro 任务有问题,FrontierMath v2 则修正了 42% 题目中的错误。作者据此指出:如果整理几百个评测任务都这么难,那大规模整理训练数据只会更难,这也解释了 Scale AI 2025 年据称约 20 亿美元营收为何合理。结论是:benchmark 分数有价值,但最能说明模型好坏的,往往还是你自己工作流里的私有评测。
所属事件:业界热议:LLM基准测试易脱离真实流量误导决策(5 条相关)→
「研究」频道最新
- Bug Hunt Bench 作者补充:榜单噪声幅度约 2-3 分 — PawelHuryn · 2026-09-11
- Bug Hunt Bench 放榜:105 个真实埋 bug 横评前沿编码模型 — PawelHuryn · 2026-09-11
- 台球计算模型登 PNAS:二维系统已存在不可判定性,可跑通用计算机 — eigensteve · 2026-09-11
- 新研究:从仿射变换与重力线索求解绝对位姿 — ducha_aiki · 2026-09-11
- LoMa 论文发布 REALLY HardPairs 数据集,入选 ECCV 2026 — ducha_aiki · 2026-09-11
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11