Qwen3.8-Max 在盲测编码基准中修复 105 个 bug 里的 19 个
breath_mirror · x · 2026-08-04
一项盲测 bug 基准把 Qwen3.8-Max 放在了编码模型中游,和阿里“coding 新标杆”的宣传形成反差。
- 测试覆盖 2 个真实仓库、105 个隐藏 bug、11 个前沿模型,共 15 次运行。
- Qwen3.8-Max 最终修复 19 个 bug,耗时 148 分钟,花费 31.10 美元。
- 对比来看,GPT-5.6 Sol 以 42 个修复领先,Kimi K3 和 Opus 5 都是 21 个。
- 作者承认 Qwen 也修出了 一个只有它发现的 bug,但模型跑通过程本身很折腾,遇到订阅额度和计费问题。
- 这组 benchmark 里,GPT-5.6 Luna 以 1.80 美元 修复 33 个,而 Grok 4.5 用不到 25 分钟 修复 16 个。
- 图里还写到:105 个 bug 里有 52 个没人修掉。
「编程与Agent」频道最新
- 实测 Claude 3.5 Sonnet:精准避开数据泄露陷阱 — hugobowne · 2026-08-04
- GitHub 整理 OSINT 用 MCP 服务器清单,接入 Claude 和 Cursor — tom_doerr · 2026-08-04
- Vibe coding 让 MediaPipe 这类老工具重获新生 — bilawalsidhu · 2026-08-04
- Google 公开 Agent Skills 的构建、评测与开源流水线 — _jaydeepkarale · 2026-08-04
- OpenClaw 提醒:网页、聊天和本地权限叠加的智能体不安全 — ericelliott_ · 2026-08-04
- DeepSeek V4 Flash 0731 上线 Together AI,带来 284B 参数和 1M 上下文 — togethercompute · 2026-08-04