Runescape Bench 图显示多家顶级模型挤满 Pareto 前沿
teortaxesTex · x · 2026-07-23
这张 Runescape Bench 图展示了一个非常分散的 Pareto 前沿:不同厂商的模型在成本和性能上各占一席。
图中横轴是 每次运行的平均 API 成本,纵轴是 基准测试表现。位于前沿的包括:
- Fable 5
- GPT-5.6 Terra xh
- Grok 4.5 xh
- GLM 5.2 fp4
- DS V4 Flash
- Laguna S
这张图的核心信息是:没有单一模型在所有成本/性能权衡上全面通吃。
「模型」频道最新
- Steve Hou 预判美国开源模型将随企业推理需求爆发 — soumitrashukla9 · 2026-07-23
- 马斯克称 GPT-5 或 GPT-6 可能接近最聪明人类 — kevinnbass · 2026-07-23
- X 用户吐槽:发一个 prompt 就被模型拦了 — gabriel1 · 2026-07-23
- Kimi K3 被指 27 分钟、32 个 agents 找到并利用 Redis 0day — HanchungLee · 2026-07-23
- Reddit 盘点 2B 激活参数 MoE 的中间档空白 — WhoRoger · 2026-07-23
- ClinicalBench 更新:Kimi K3 解出 10 题中的 7 题 — teortaxesTex · 2026-07-23