作者开源 Benchmark Heaven:按单任务真实成本对比模型,揭定价假象

airesearch12 · x · 2026-09-18

开发者 airesearch12 推出免费开源项目 Benchmark Heaven,核心观点是「每百万 token 单价是个谎言」:一个单价更便宜但思考时间翻倍的模型,实际并不更省钱。该项目按「每个真实任务的成本」对比模型,计入输入/输出 token、推理消耗、缓存,并支持按厂商筛选。作者还给出测算结论:GLM-5.3 相比 Gemini 3.8 Flash 其实更「刷榜」。项目为免费开源的兴趣之作,旨在帮用户选到真正性价比高的模型。

所属事件:Benchmark Heaven 上线:聚合 100 项基准 800 模型,按真实任务成本对比(8 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →