前沿基准评测单模型花费破1万美元
jyangballin · x · 2026-10-01
KLieret 指出,在前沿基准上跑评测从未如此昂贵:在 ProgramBench 上,评完一个模型的成本已超过 1 万美元。因此他给出了一个换视角的排名——按「每美元能完成的任务数」来衡量模型性价比,而不是只看绝对分数。
「模型」频道最新
- Fireworks 发布 Ember-1:基于 Kimi K3,更少 token 性能持平 — sophiamyang · 2026-10-01
- MiniMax 预告新起点:MiniMax Code 不止于写代码 — iamaliveix · 2026-10-01
- 注意力头间互通的 IHA 被 NeurIPS 接收,RULER 检索提升 10-20% — _arohan_ · 2026-10-01
- 开发者盛赞 Opus 5.5 状态输出:像资深工程师一样汇报进度 — sytelus · 2026-10-01
- 未专门训练的 d1 模型打出《任天堂明星大乱斗》高水准对战 — maximelabonne · 2026-10-01
- GPT-6 Astra 偏好 CDT 而非 EDT,与 Anthropic 模型决策理论倾向形成反差 — dfrsrchtwts · 2026-10-01