「每百万 token 价格」是谎言:思考更久的便宜模型并不便宜

airesearch12 · x · 2026-09-18

作者推出 Benchmark Heaven 评测思路,核心观点是单看每百万 token 定价会被误导——一个单价便宜但推理时间翻倍的模型,实际完成任务的成本可能更高。该基准按「每个实际任务的成本」计价,并纳入供应商筛选、输入输出 token、推理长度与缓存等因素,结论可能与榜单印象大相径庭。

作者还提出 Benchmaxxing 分数用于识别模型是否在测试集上训练:引用率高的公开基准上表现极强(99%),而在无法针对训练的新基准或私有基准上明显偏弱,即典型的「刷榜」特征。

所属事件:开发者开源 Benchmark Heaven:聚合百项基准按真实任务成本评测模型(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →