105 个埋 bug 实测:Qwen3.8-27B 三次运行超过单次 Opus 4.8

PawelHuryn · x · 2026-09-17

作者 PawelHuryn 在 2 个真实代码库中埋入 105 个 bug,实测本地 LLM 的「查找并修复」能力。单次运行成绩:Opus 4.8 (max) 找出 15 个,Qwen3.8-27B 8-bit 为 10.7,Sonnet 5 (high) 为 9,Gemma 4 31B 仅 4,gpt-oss-120b 一个都找不到(基本不可用)。

最大惊喜是 Qwen3.8-27B:该模型 8-bit 量化版约 28.6 GB,200K 上下文可在 64 GB 的 Mac mini 上舒适运行,且连续跑 3 次累计超过单次 Opus 4.8 (max) 的成绩——作者认为这是本地模型在真实工程任务上的有力证据。

所属事件:Bug Hunt Bench 实测:本地 Qwen3.8-27B 修虫能力逼近 Opus(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →