Qwen Code 全量跑 SWE-bench Verified 拿下 76.16%,500 题解析 377 题
DennisYu07 · ghdev · 2026-08-21
QwenLM/qwen-code 发布端到端全量基准测试结果(v0.21.15,模型 qwen3.7-plus):
- SWE-bench Verified:500 题全部完成,377 题解决、118 题未解决、2 个执行错误、3 个基础设施失败,得分 76.16%(分母为有效评分结果 495)。
- 随后进行 Terminal-Bench 2.0(89 题),含验证器支持的结果与轨迹回写。
- 案例轨迹打包为 swe-bench-verified-dsw-eas-full-20260821-r1-trajectories.tar.gz,完整运行记录可在 GitHub Actions 查看。
「编程与Agent」频道最新
- Agent 编程普及将重塑公众对软件开发的认知 — pixlpa · 2026-08-24
- Devin 突破 Slack 阻塞,自主发邮件求反馈 — sandylikesfrogs · 2026-08-24
- 从发号施令到协作,开发者使用Agent习惯转变 — latticecut · 2026-08-24
- 开发者不再写代码:瓶颈已从写代码转为读代码 — thursdai_pod · 2026-08-24
- 普通人用 AI 最大的错:总想造轮子而非用好工具 — Tired40s · 2026-08-24
- DeepPaperNote:将单篇论文转为 Obsidian 研究笔记 — tom_doerr · 2026-08-24