Real-SWE 基准发布:用私有企业代码库实测前沿模型编程力

zainhas · x · 2026-09-12

Specific Labs 发布 Real-SWE 基准,评测对象是前沿 AI 模型在私有、真实世界企业代码库上的编程表现,区别于基于公开仓库的合成基准。首期成绩:Fable 5.1 38.8%、GPT-6 Astra 33.8%、GLM-5.3 28.8%,开源模型已能逼近闭源前沿。基准详情见 realswe.withspecific.com。

所属事件:Real-SWE 基准发布 GLM-5.3 逼近 GPT-6 Astra(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →