Grok 4.5 登顶 VulcanBench,编程任务解决率与成本双杀
XFreeze · x · 2026-08-05
在 VulcanBench 基准测试中,Grok 4.5 在 23 个真实代码合并任务(涵盖 Python、Rust 等五种语言)里以 91.3% 的解决率夺得第一。
除了准确率领先,Grok 4.5 在成本上也具有显著优势:单任务成本仅为 0.32 美元。相比之下,Claude Fable 5 和 GPT-5.6 Sol 的最高解决率为 20/23,而 Kimi K3 虽然最终达到了相同的解决数量,但需要两小时的扩展时间,且单任务成本高达 1.37 美元。
「模型」频道最新
- AI 也需要补觉?开发者曝光 GPT 思维链搞笑翻车 — cantrell · 2026-08-05
- engyai 上线 OpenRouter 最廉价 Kimi K3 API,成本降半 — const_reborn · 2026-08-05
- LiquidAI 新模型实测:Mac 本地跑 128K 上下文解码达 82 tok/s — helloiamleonie · 2026-08-05
- 5p6 Sol Extra High 模型被指患有“拖延症” — RylanSchaeffer · 2026-08-05
- DeepSeek订阅额度极限压测:性价比能否超越Gemini? — teortaxesTex · 2026-08-05
- 128GB 内存 Mac 跑本地大模型,哪款最适合写代码? — Electronic_Back1502 · 2026-08-05