Real-SWE 基准发布:用私有企业代码库实测前沿模型编程力
zainhas · x · 2026-09-12
Specific Labs 发布 Real-SWE 基准,评测对象是前沿 AI 模型在私有、真实世界企业代码库上的编程表现,区别于基于公开仓库的合成基准。首期成绩:Fable 5.1 38.8%、GPT-6 Astra 33.8%、GLM-5.3 28.8%,开源模型已能逼近闭源前沿。基准详情见 realswe.withspecific.com。
所属事件:Real-SWE 基准发布 GLM-5.3 逼近 GPT-6 Astra(2 条相关)→
「模型」频道最新
- HSVSphere 吐槽 Opus 5 越用越慢:宁愿去读 Cisco 文档 — yacineMTB · 2026-09-12
- 「中国 AI 采用率低」是误读:日耗 token 140T 远超美国 45-50T — pstAsiatech · 2026-09-12
- DeepSeek V4.1 Flash 内核工程大幅进步,GLM-5.3 Flash 相去甚远 — teortaxesTex · 2026-09-12
- AI 攻克千禧年数学难题:加速进展背后的双面叙事 — pstAsiatech · 2026-09-12
- V4.1 在 Terminal-Bench-Science 拿 11/70,物理科学表现超 Opus 5 — teortaxesTex · 2026-09-12
- 用户吐槽 Grok 聊天搜索不支持布尔运算,越搜越多 — chrisgrayson · 2026-09-12