Benchmark Heaven 上线:100 项基准、800 模型、真实任务成本
airesearch12 · x · 2026-09-18
Benchmark Heaven 上线(BETA),一个免费、无广告、无融资的 AI 模型评测聚合站:
- 覆盖 100 项基准、800 个模型,一站式对比
- 首创「Benchmaxxing score」,衡量模型刷基准的倾向
- 展示每任务真实成本(real cost per task),而非简单的 $/token
- 提供复合评分(Composite Score)与按编码/Agent/科学/长上下文等维度的分榜
- 可按托管地(中国/EU/US)、数据保密政策、开源与否筛选,并支持自定义输入输出价格配比与任务负载
适合选型时替代零散查榜单。
所属事件:Benchmark Heaven 上线:开源评测聚合站按真实任务成本对比模型(7 条相关)→
「模型」频道最新
- OpenAI 发布 Astra for Law,自报基准成绩超越 GPT-6 Astra — ahelkky · 2026-09-18
- Salesforce 首个推理模型 Koa 发布,源自三年前 function calling 押注 — huan__wang · 2026-09-18
- Benchmark Heaven 上线:聚合全模型跑分与成本的可调权对比工具 — airesearch12 · 2026-09-18
- 用户质疑 Claude 悄悄撤回"9 月 20 日前额度加 50%"承诺 — ThePeterMick · 2026-09-18
- 网友曝看到 Gemini 4 跑分页:4 Flash 力压 Fable 5.1 — teortaxesTex · 2026-09-18
- DeepSeek v4.1 flash 首字延迟对比:Together 预热查询领先 — zhyncs42 · 2026-09-18