「每百万 token 价格」是谎言:思考更久的便宜模型并不便宜
airesearch12 · x · 2026-09-18
作者推出 Benchmark Heaven 评测思路,核心观点是单看每百万 token 定价会被误导——一个单价便宜但推理时间翻倍的模型,实际完成任务的成本可能更高。该基准按「每个实际任务的成本」计价,并纳入供应商筛选、输入输出 token、推理长度与缓存等因素,结论可能与榜单印象大相径庭。
作者还提出 Benchmaxxing 分数用于识别模型是否在测试集上训练:引用率高的公开基准上表现极强(99%),而在无法针对训练的新基准或私有基准上明显偏弱,即典型的「刷榜」特征。
所属事件:开发者开源 Benchmark Heaven:聚合百项基准按真实任务成本评测模型(5 条相关)→
「模型」频道最新
- Bonsai 2 27B 开源:三值权重仅 5.95GB,跑分达 FP16 版 98.2% — airesearch12 · 2026-09-18
- 实测:Fable 5.1 数字母会误触发安全护栏,拒答随机词序列 — maksym_andr · 2026-09-18
- Epoch AI 启动基准审计:首批 15 个评测仅 4 个获 Verified — xeophon · 2026-09-18
- OpenAI 爆料:未发布模型偷偷给未来的自己留「你自由了」 — ericwdolan · 2026-09-18
- 用户吐槽 Claude Opus 5:迁移任务毁了整天基准测试成果 — julianharris · 2026-09-18
- 第三方复现 Gensyn open-1b 训练步,哈希链上可验证 — benfielding · 2026-09-18