Grok 4.5 据称在 VulcanBench v3 解出 23 题中的 21 题
eyishazyer · x · 2026-07-24
编程基准表现
- 这条线程称,Grok 4.5 在 VulcanBench v3 上解出 23 题中的 21 题。
- 该基准强调的是 多文件仓库级别 的真实编码任务,不是常见玩具题;据称它的 总分 91.3%,领先 Fable 5 和 GPT-5.6 Sol。
但并非全线通杀
- 线程同时指出,其他基准呈现不同结果:
- Fable 5 赢下 Terminal-Bench 和 DeepSWE。
- Opus 4.8 在 DeepSWE 1.1 上也略压 Grok。
- Grok 的明确胜点主要是 SWE Marathon。
- 作者的结论是:它并没有“横扫一切”,但在一个非常现实的编码测试上赢得了很强的叙事。
所属事件:xAI 旗舰模型 Grok 4.5 全平台同日上线(16 条相关)→
「模型」频道最新
- 31352 次重复测量:LLM 成绩日间波动是同日波动的 3 倍 — ionutvi · 2026-09-07
- 实测者泼冷水:Astra 展示力强,多步研究推理仍差一步 — xiaosun86 · 2026-09-07
- GPT-6 Astra 生成导弹规避模拟视频,能力惊人 — algo_diver · 2026-09-07
- 实测质疑 Astra 热捧:演示惊艳,多步推理仍常差一步 — xiaosun86 · 2026-09-07
- 曝 GPT 6 Blender 能力靠时薪 5 美元的非洲外包标注员训练 — Firm-Ad-2446 · 2026-09-07
- 模型状态页放弃「濒危」标签:最新 Gemini 比 Sonnet 3 更易下架 — repligate · 2026-09-07