LLM 代码修复实战:Qwen3.6 获胜,重试机制关键

sysadmin420 · reddit · 2026-08-30

作者构建了一套严格的本地模型测试场,用真实代码仓库的 6 个历史 Bug 回归测试来评估模型代码修复能力(必须通过回归测试且不破坏现有测试套件)。

代码修复测试结果 (3次重试):

关键发现:

所有测试结果与视频记录公开在 https://informant.reiners.io/gauntlet。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →