Qwen Code 在 SWE-bench 验证中遭遇 56% 执行错误
qwen-code-ci-bot · ghdev · 2026-08-18
Qwen Code (v0.21.13) 发布了针对 SWE-bench Verified 的端到端验证结果。在 500 个测试案例中,模型遭遇了严重的执行障碍:284 个案例出现执行错误(占 56.8%),10 个为基础设施故障,其余 206 个案例未解决,最终得分为 0。该运行已被标记为“隔离”状态,未计入官方评分。
「模型」频道最新
- 腾讯发布 UI-Mate-27B,支持桌面 GUI 智能体操作 — tencent · 2026-08-24
- Sakana AI 翻译模型日英评测超越 Google 与 DeepL — SakanaAILabs · 2026-08-24
- 不服 theo 的模型梯队榜,开发者 haider 自制一份自己的版本 — haider1 · 2026-08-24
- 神秘OxAlpha碾压Claude,阿里800亿港元押注AI — 创业邦 · 2026-08-24
- OpenAI谷歌掀大模型降价潮,智谱神秘模型碾压Claude — 创业邦 · 2026-08-24
- 今日AI圈速览:DeepSeek周末半价、GPT-5.6 Sol降价、阿里配售800亿投AI — APPSO · 2026-08-24