Grok 4.5 跃居 FrontierSWE 第二

7 月 15 日,马斯克表示 Grok 4.5 已在 FrontierSWE 软件工程基准测试中升至第 2,这也成为本组讨论的核心。多条后续帖子将这一成绩解读为:Grok 4.5 已进入当前软件工程模型的头部阵营,因此在编码能力与代理式开发场景中的竞争力受到关注。

关键细节

根据马斯克的说法,Grok 4.5 在 FrontierSWE 榜单上排名第 2。@amanmadaan 转述的 Proximal FrontierSWE 评测结果补充称,Grok 4.5 在综合实现与性能维度位列第 2,排在 Claude Fable 5 之后;在研究能力维度则排名第 1。

外界解读

@XFreeze 认为,Grok 4.5 的编码能力已处于第一梯队,并称其在这一榜单上的表现超过了 Claude Opus 4.8 和 GPT-5.5。他还把速度快、token 利用效率高视为该模型的重要特点。另一条帖子里,@XFreeze 进一步强调,Grok 4.5 在取得顶尖成绩的同时,使用的 token 明显少于 Fable 5,这也是讨论中被反复提到的优势之一。

2026-07-15 ~ 2026-07-16 · 5 条相关

事件全程(共 20 集)→

一手来源