Grok 4.7 包揽 VulcanBench 前三,仓库级编程测试最高 93.15 分
XFreeze · x · 2026-10-06
Grok 4.7 在 VulcanBench Frontier v4 上拿下前三名,超过 Fable 5.1、Opus 5.5、GPT-6 Astra、GPT-6.1 Sol 等前沿模型:
- Grok 4.7 xHigh:93.15 分,23/23 任务全通过
- High:92.71 分,22/23 通过
- Medium:92.30 分,21/23 通过
该 benchmark 考察仓库级软件工程能力而非孤立代码片段:包含 23 个行为重建任务,要求模型重建遗留软件以匹配其实际行为,通过隐藏测试检验功能正确性,并附带安全、lint/复杂度与代码质量评估。
「编程与Agent」频道最新
- 律所AI采用仍处初级:多数律师只会一次性提示词 — jkubicki · 2026-10-06
- GPT-2×Codex 造出「眨眼外星人」追踪器,遮挡即认输 — MikePFrank · 2026-10-06
- Codex 任务小组件出错?编辑小组件手动指定 host 即可临时修复 — Dimillian · 2026-10-06
- xAI TypeScript SDK 升级 v0.2.2,retryBeforeOutput 支持无流式重试 — tetsuoai · 2026-10-06
- Hugging Face Kernels 教程:一行代码加载 GPU 优化计算核 — ariG23498 · 2026-10-06
- Lovable CEO 宣布 2026「用 AI 建一家公司」,网友让其别犯错 — santiviquez · 2026-10-06