Benchmark Heaven 上线:聚合全模型跑分与成本的可调权对比工具
airesearch12 · x · 2026-09-18
一个名为 Benchmark Heaven 的模型评测与成本对比站(BETA)上线,自称「最详细的成本-能力分析」。
- 聚合 AA Coding Agent、DesignArena、Epoch ECIE 等多套基准,支持综合评分排序,可开启「Benchmaxxing」信号加权
- 价格维度可切换多种 input/output 混合比例(1:1 到 100:1 等),并提供 Adjusted costs 调整口径
- 支持按模型/提供商/实验室的地区(中国/欧盟/美国)筛选,区分推理托管地与公司注册地
- 附数据保密性标注(提供商是否会用你的 prompt 训练或留存数据)
所属事件:Benchmark Heaven 开源上线:百项基准、800 模型按真实任务成本对比(9 条相关)→
「模型」频道最新
- 曝 GPT-6 Astra 登顶 FrontierSWE,600MB 音频压缩至 20KB — soumitrashukla9 · 2026-09-18
- 博主实测 Meta Muse Code:便宜得出奇且质量在线 — AIandDesign · 2026-09-18
- 社区一天揭面:OpenRouter 匿名模型 Union Alpha 实为 Pareto 26.9 — gaganghotra_ · 2026-09-18
- Emad 转发:8GB 内存设备也能跑 Opus 4.5 级模型 — ccerrato147 · 2026-09-18
- Astra 计算机使用自动排版 Google 文档,体验者称久违的魔法感 — var_epsilon · 2026-09-18
- 曝 GPT-6 Astra 以 65.5% 居 FrontierSWE 榜首,远超前代 — charliermarsh · 2026-09-18