专家质疑大模型基准测试:精心挑选指标即可得出任意结论
felix_red_panda · x · 2026-08-03
针对近期的大模型基准测试结果,Felix 指出这是一个典型的“通过精确控制评测基准来得出任意结论”的案例。
他特别批评了在 batch size 为 1 时的 tok/sec/$(每秒每美元 token 数)指标表现十分荒谬:测试方在表面上声称不关心成本,但在实际对比中却只挑选了次优的方案来展示。
所属事件:专家质疑大模型评测:挑选指标即可得出任意结论(2 条相关)→
「模型」频道最新
- EpochAI 更新榜单:Claude Fable 5 长程任务得分远超 GPT-5.6 — Jsevillamol · 2026-08-04
- 传 OpenAI 将发 Astra 模型,主打多智能体协同 — thesaraharminta · 2026-08-04
- 实测 Qwen3.8-Max:开源模型在 Agent 任务已逼近闭源前沿 — dair_ai · 2026-08-04
- 推测 Kimi K3 达 2.8T 参数,或由更小的 Opus 蒸馏 — gabriberton · 2026-08-04
- 专家24小时复现OpenAI数学成果,Astra被指非质变 — Gary Marcus · 2026-08-04
- 实测吐槽:Claude 3.5 Sonnet 与 Opus 做幻灯片效果极差 — nathanbenaich · 2026-08-04