Grok 4.7 包揽 VulcanBench 前三,仓库级编程测试最高 93.15 分

XFreeze · x · 2026-10-06

Grok 4.7 在 VulcanBench Frontier v4 上拿下前三名,超过 Fable 5.1、Opus 5.5、GPT-6 Astra、GPT-6.1 Sol 等前沿模型:

该 benchmark 考察仓库级软件工程能力而非孤立代码片段:包含 23 个行为重建任务,要求模型重建遗留软件以匹配其实际行为,通过隐藏测试检验功能正确性,并附带安全、lint/复杂度与代码质量评估。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →