重试加池化选优:Qwen3.8 27B 在 DeepSWE 1.1 达 92.04%
S_Conradi · x · 2026-09-16
开发者 bnjmnmarie 实测:通过大量重试并做跨配置候选池化,Qwen3.8 27B 在 DeepSWE 1.1 上可达 92.04%,比 GPT-6 Astra 公布的约 74% 高出约 18 个百分点。
- 作者跑了 20 种配置(不同 harness、思考档位、量化),发现覆盖率差异很大:两次同为 31.86% reward 的运行,在 113 个任务上有 42 个判断不一致,量化模型尤甚
- 池化方法:对每个任务,只要任意一个候选通过全部新测试即算通过,不做补丁混用
- Best-of-k 结果:k=1 时 81.43% F2P / 37.21% reward;k=10 达 98.31% / 86.25%;k=20 达 99.18% / 92.04%
- 结论:这是 oracle 选择的跨配置覆盖率,不是单次运行准确率;27B 模型能为大多数任务产出可通过的解,真正的难点是可靠性与选对候选。若配套强独立的验收与回归测试,「生成→验证→重试」的提升路线并非不切实际
「模型」频道最新
- Ars Technica 独家:中国开源模型正快速逼近硅谷前沿水平 — alexvoica · 2026-09-16
- 自称 ChatGPT 联合发明者发布模型 Jev:宣称零幻觉、输出 token 免费 — damianplayer · 2026-09-16
- OpenAI 研究科学家 Noam Brown:模型「研究品味」再一两个版本或超我 — haider1 · 2026-09-16
- Google 发布 Gemini 3.8 Live 与 Live Extended Thinking 对话模型 — leslysandra · 2026-09-16
- 输出概率而非文字的新型语言模型:评测速度快 25 倍、成本低 600 倍 — danshipper · 2026-09-16
- Lithos 团队:别拿 benchmark 当选型铁证,先定义自身指标 — JiaZhihao · 2026-09-16