作者开源 Benchmark Heaven:按单任务真实成本对比模型,揭定价假象
airesearch12 · x · 2026-09-18
开发者 airesearch12 推出免费开源项目 Benchmark Heaven,核心观点是「每百万 token 单价是个谎言」:一个单价更便宜但思考时间翻倍的模型,实际并不更省钱。该项目按「每个真实任务的成本」对比模型,计入输入/输出 token、推理消耗、缓存,并支持按厂商筛选。作者还给出测算结论:GLM-5.3 相比 Gemini 3.8 Flash 其实更「刷榜」。项目为免费开源的兴趣之作,旨在帮用户选到真正性价比高的模型。
所属事件:Benchmark Heaven 上线:聚合 100 项基准 800 模型,按真实任务成本对比(8 条相关)→
「模型」频道最新
- OpenRouter 神秘「Stealth Union Alpha」隐身模型引猜测 — Iory1998 · 2026-09-18
- Typesafe AI 发布低延迟可引导通用分类器,获用户点赞 — andreisavu · 2026-09-18
- Cactus 发布 8-29MB 端侧模型 Needle 3,树莓派上跑出 4k tokens/s — airesearch12 · 2026-09-18
- 用 Jev 给博主 100 条视频打带货分:12 秒、成本仅 2 美分 — eptwts · 2026-09-18
- InstructGPT 论文作者 Diogo 造新模型,先出「快好省不可兼得」言论 — danshipper · 2026-09-18
- 曝多家中国 AI 实验室两年内竞逐 10-40 万亿参数大模型 — troll_khan · 2026-09-18