Grok 4.5 登顶 VulcanBench,编程任务解决率与成本双杀

XFreeze · x · 2026-08-05

在 VulcanBench 基准测试中,Grok 4.5 在 23 个真实代码合并任务(涵盖 Python、Rust 等五种语言)里以 91.3% 的解决率夺得第一。

除了准确率领先,Grok 4.5 在成本上也具有显著优势:单任务成本仅为 0.32 美元。相比之下,Claude Fable 5 和 GPT-5.6 Sol 的最高解决率为 20/23,而 Kimi K3 虽然最终达到了相同的解决数量,但需要两小时的扩展时间,且单任务成本高达 1.37 美元。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →