SWE-rebench 新增五语言编程评测,GLM-5.2 领跑开源模型
Fabulous_Pollution10 · reddit · 2026-07-29
SWE-rebench 发布了一个重要的多语言更新,把真实软件工程任务扩展到 Go、Java、Python、Rust 和 TypeScript 五种语言。
- 新版榜单在原本以 Python 为主的基础上,加入了多语言切片。
- 开放权重模型里,GLM-5.2 [high] 目前领先,Pass@1 为 62.9%,Pass@5 为 81.1%。
- 榜单还列出了 MiniMax M3、MiMo V2.5 Pro、DeepSeek-V4 Pro、Qwen3.6-27B、Qwen3.6-35B-A3B、Qwen3.5-35B-A3B 等结果。
- 团队表示,下一次更新预计在 3–4 周后,重点会转向适合本地部署的模型。
- 他们也在征集真正用于本地软件开发或 coding agent 的模型建议,并提供了数据集供自行跑 agent 复现。
「研究」频道最新
- Cohere Labs 将在 Deep Learning Indaba 带来 Triton 教程和 AI 圆桌 — Cohere_Labs · 2026-07-29
- UltraEP 把 MoE 实时均衡带进小红书机架级推理栈 — 机器之心 · 2026-07-29
- Triangle Splatting SLAM 用可微三角形做密集 RGB-D 建图 — janusch_patas · 2026-07-29
- DLBCN 2026 面向巴塞罗那深度学习研究开放征稿 — serrjoa · 2026-07-29
- NVIDIA PDD 用 4–8 步蒸馏加速图像和视频生成 — nvidia · 2026-07-29
- TD-JEPA 从离线日志学时间进展,控制任务全面优于 LeWM — HKBU-KnowComp · 2026-07-29