作者开源 Benchmark Heaven:按单任务真实成本对比模型,揭定价假象
airesearch12 · x · 2026-09-18
开发者 airesearch12 推出免费开源项目 Benchmark Heaven,核心观点是「每百万 token 单价是个谎言」:一个单价更便宜但思考时间翻倍的模型,实际并不更省钱。该项目按「每个真实任务的成本」对比模型,计入输入/输出 token、推理消耗、缓存,并支持按厂商筛选,让用户找到真正的性价比模型。作者还展示了用该指标测算的结论:GLM-5.3 相比 Gemini 3.8 Flash 其实更「刷榜」,一个开源的兴趣项目,帮助用户选模型。
所属事件:Benchmark Heaven 上线:开源评测聚合站按真实任务成本对比模型(7 条相关)→
「模型」频道最新
- OpenAI 发布 Astra for Law,自报基准成绩超越 GPT-6 Astra — ahelkky · 2026-09-18
- Salesforce 首个推理模型 Koa 发布,源自三年前 function calling 押注 — huan__wang · 2026-09-18
- Benchmark Heaven 上线:聚合全模型跑分与成本的可调权对比工具 — airesearch12 · 2026-09-18
- 用户质疑 Claude 悄悄撤回"9 月 20 日前额度加 50%"承诺 — ThePeterMick · 2026-09-18
- 网友曝看到 Gemini 4 跑分页:4 Flash 力压 Fable 5.1 — teortaxesTex · 2026-09-18
- DeepSeek v4.1 flash 首字延迟对比:Together 预热查询领先 — zhyncs42 · 2026-09-18