Grok Build 4.7 登顶 DeepSWE 榜,代码仓库修改能力引热议

Kuprel · x · 2026-09-24

据 Artificial Analysis 的 DeepSWE 基准榜单,Grok Build 4.7 登顶,得分超过 OpenAI 的 Astra。作者就此质疑:Grok Build 4.7 在「修改代码仓库」类任务上已超过 OpenAI 的 Astra,并向马斯克喊话求证。该榜单反映的是 agent 修改真实仓库的软件工程能力,若属实则意味着 xAI 的编码 agent 能力已领先。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →