Real-SWE 基准发布 GLM-5.3 逼近 GPT-6 Astra

Specific Labs 发布 Real-SWE 基准,区别于基于公开仓库的合成基准,专门评测前沿 AI 模型在私有、真实企业代码库上的编程表现。首期成绩显示 Fable 5.1 以 38.8% 领先,GPT-6 Astra 达 33.8%,GLM-5.3 拿下 28.8% 逼近 GPT-6 Astra,反映出各模型在真实工程环境中的差距。

2026-09-12 ~ 2026-09-12 · 2 条相关