Benchmark Heaven 一站聚合 264 个 LLM 评测与 870 个模型成本
airesearch12 · x · 2026-09-28
一个名为 Benchmark Heaven 的免费网站(Beta)将 264 个 LLM benchmark 和 870 个模型汇总在同一处,并支持跨模型、跨供应商的成本—能力对比分析。
主要功能与可定制维度:
- 多种复合评分与单项榜单:编码 agent、智能体工具使用、科学、长上下文等,并可调节是否纳入「Benchmaxxing」信号
- 成本口径可切换:固定 I/O 配比、仅输出、10:1/30:1/100:1 等多种输入输出权重,以及按 OpenRouter 实际任务用量计价
- 区域筛选:可按推理托管地、供应商注册地、实验室所在地区分中国/欧盟/美国,EU 托管逐条对照官方文档核实,明确全球部署与欧盟计费区不算 EU 托管
- 数据保密性筛选:标注哪些供应商会训练或保留你的 prompt
作者以「Harold 花了四十年归档,现在只剩一个抽屉」的口吻发布,网站免费开放。
「模型」频道最新
- Opus 被护栏拦住时还叫 Opus 吗?网友调侃命名困境 — repligate · 2026-09-28
- AI 给出的多汗症治疗方案详细如专科医生,网友直呼罕见 — chaumian · 2026-09-28
- 网友记录 ChatGPT 约 25 次造稻草人再道歉的循环行为 — LAguy8394 · 2026-09-28
- 「肥皂泵基准」:五款旗舰模型同题比拼 HTML 动画 — Foxiya · 2026-09-28
- 网友猜 OpenAI 新 Agent 命名:盼复活「Orion」而非「o.」 — brandon_galang · 2026-09-28
- 普林斯顿教授纠错:Ember 与 GLM 根本不在 Pareto 前沿上 — random_walker · 2026-09-28