LLM 代码修复实战:Qwen3.6 获胜,重试机制关键
sysadmin420 · reddit · 2026-08-30
作者构建了一套严格的本地模型测试场,用真实代码仓库的 6 个历史 Bug 回归测试来评估模型代码修复能力(必须通过回归测试且不破坏现有测试套件)。
代码修复测试结果 (3次重试):
- qwen3.6:35b-a3b: 3/6
- devstral:24b: 2/6
- Qwen3-coder:30b: 1/6
- qwen2.5-coder:14b: 1/6
- deepseek-coder-v2:16b: 0/6
关键发现:
- 引入重试机制(将错误反馈给模型)显著改变了结果,说明模型更擅长迭代而非一次性解决。
- 视觉模型测试中,qwen3-vl:8b 完美识别渲染图像中的数字,而 llava:13b 幻觉严重。
所有测试结果与视频记录公开在 https://informant.reiners.io/gauntlet。
「编程与Agent」频道最新
- 智能体SDLC:工程师从实施者转为编排者 — Pavan_Belagatti · 2026-08-30
- Agent 在沙盒正常却生产环境报错,如何测试? — Common_Dream9420 · 2026-08-30
- TrustScoreAgent:给 Agent 的服务信誉注册表 — TrustScoreAgent · 2026-08-30
- 做 Agent 记忆层:瓶颈不在模型而在基础设施 — shbong · 2026-08-30
- Arcturus Bot 接入 GPT-image-2,展示群聊图像生成实例 — MikePFrank · 2026-08-30
- 技术解析:在边缘设备实现 ColBERT 风格的超维度记忆门控 — Equivalent-Flan-1590 · 2026-08-30