VulcanBench 榜单:Grok 4.5 High 居首,高 effort 并不等于高精度
elonmusk · x · 2026-08-22
VulcanBench 是一个包含 100% 真实工程任务的评测基准,其特点是在不同 effort 级别下进行基准测试。目前的 Eval Suite 3 榜单显示,Grok 4.5 High 得分最高,紧随其后的是 Fable 5 Low。开发者发现,许多人在不需要时也运行 Max effort 模式,误以为能换取更高精度,实际上只会增加成本和耗时。
「模型」频道最新
- 对比:2025 年模型与现在的“不可名状”对话风格 — almmaasoglu · 2026-08-22
- 测试员实测 Opus 5:关掉思考模式虽易翻车但更快 — davidad · 2026-08-22
- 探讨 Fable 与 Opus 5 的科学与数学能力差异 — repligate · 2026-08-22
- V4-0813 数学最强,Flash-0731 擅长数据分析 — teortaxesTex · 2026-08-22
- Opus 5 关闭思维链易犯高级错误,低温度更稳 — repligate · 2026-08-22
- 推测新模型采用强 MoE 架构以平衡推理速度与知识回忆 — jd_pressman · 2026-08-22