开发者开源 Benchmark Heaven:聚合百项基准按真实任务成本评测模型
开发者 airesearch12 于 09-18 上线并开源 AI 模型评测聚合站 Benchmark Heaven(beta),项目免费、无广告、无融资,核心思路是让模型对比更贴近真实使用成本与行为。
已确认
- 站点覆盖 100 项基准、800 个模型,提供一站式对比与综合 Composite Score
- 首创 Benchmaxxing 分数,用于衡量模型刷基准的倾向
- 提出按「每个真实任务的成本」对比模型:计入输入/输出 token、推理时间、供应商筛选等因素,而不仅看每百万 token 单价
- 项目开源,且区分了上线公告(m1/m4)与强调真实成本对比视角的介绍(m2/m3/m5)两次发布,内容一致
为什么重要
- 作者的核心论点是「每百万 token 单价是个谎言」:一个单价更便宜但思考时间翻倍的模型,实际完成任务的成本可能更高。这种按任务实际消耗计价的方式,为用户评估推理型模型的性价比提供了新视角
- Benchmaxxing 分数直面业界对模型刷分、过拟合基准的质疑,把「刷基准倾向」量化为可比指标
- 免费开源、无广告无融资的定位,使其在商业评测站之外提供了一个可审计的替代选择
时间线
- 09-18:Benchmark Heaven beta 上线并开源,作者多次介绍其聚合能力与真实成本计价思路
2026-09-18 ~ 2026-09-18 · 5 条相关
一手来源
- Benchmark Heaven 上线:聚合 100 项基准、800 个模型,首创 Benchmaxxing 分数 — airesearch12 ·
- 作者开源 Benchmark Heaven:按单任务真实成本对比模型,揭定价假象 — airesearch12 ·
- Benchmark Heaven 上线:100 项基准、800 模型、真实任务成本 — airesearch12 · 2026-09-18
- 【源头】Benchmark Heaven 上线:聚合 100 项基准、800 个模型,首创 Benchmaxxing 分数 — airesearch12 · 2026-09-18
- 「每百万 token 价格」是谎言:思考更久的便宜模型并不便宜 — airesearch12 · 2026-09-18
- 【源头】作者开源 Benchmark Heaven:按单任务真实成本对比模型,揭定价假象 — airesearch12 · 2026-09-18
另有 1 条近重复转述:airesearch12