Grok Build 4.7 登顶 DeepSWE 榜,代码仓库修改能力引热议
Kuprel · x · 2026-09-24
据 Artificial Analysis 的 DeepSWE 基准榜单,Grok Build 4.7 登顶,得分超过 OpenAI 的 Astra。作者就此质疑:Grok Build 4.7 在「修改代码仓库」类任务上已超过 OpenAI 的 Astra,并向马斯克喊话求证。该榜单反映的是 agent 修改真实仓库的软件工程能力,若属实则意味着 xAI 的编码 agent 能力已领先。
「模型」频道最新
- 第三方推出基于 GLM 的 DeepThink,押注开源模型极限推理路线 — krzonkalla · 2026-09-24
- Claude Opus 5.5 一次提示词写出生成 90 年代风格 demoscene 演示 — PurzBeats · 2026-09-24
- 曝 OpenAI 效率布局:GPT-6 Luna 主打性价比,Sol 低价保留多数智能 — haider1 · 2026-09-24
- 网传「Claude Opus 5.5 对 ChatGPT 6 Astra」对比视频,模型名存疑 — balianone · 2026-09-24
- 拍 4 张白板照片,Astra 一次完成识别、OCR 并矢量化 — iskander · 2026-09-24
- 用户实感:Claude 额度机制生变,本周主要被 Opus 限额卡住 — rudrank · 2026-09-24