RealSWE 新榜:GLM-5.3 拿 28.8%,逼近 GPT-6 Astra
zainhas · x · 2026-09-12
Specific Labs 发布的 Real-SWE 基准(在私有真实企业代码库上评测前沿模型)最新结果:Fable 5.1 拿下 38.8%,GPT-6 Astra 33.8%,GLM-5.3 28.8%。作者表示没想到 GLM-5.3 与前两者已经差距不大,开源阵营与闭源前沿的编程能力差距正在缩小。
所属事件:Real-SWE 基准发布 GLM-5.3 逼近 GPT-6 Astra(2 条相关)→
「模型」频道最新
- AI 攻克千禧年数学难题:加速进展背后的双面叙事 — pstAsiatech · 2026-09-12
- V4.1 在 Terminal-Bench-Science 拿 11/70,物理科学表现超 Opus 5 — teortaxesTex · 2026-09-12
- 用户吐槽 Grok 聊天搜索不支持布尔运算,越搜越多 — chrisgrayson · 2026-09-12
- 传 Google 即将发布新模型,预期超越 GPT 5.6 Sol — imjustnewatai · 2026-09-12
- 键盘手向最强模型下战书:能否复刻一首歌的专业键盘演出音色 — AdBest4099 · 2026-09-12
- xAI 曾宣布本周发布 Grok 4.7,如今却称'还需再打磨' — alejandroll10 · 2026-09-12