Bug Hunt Bench 实测:本地 Qwen3.8-27B 修虫能力逼近 Opus

开发者 Pawel Huryn 推出 Bug Hunt Bench,在两个真实代码仓库中植入 105 个 bug,盲测前沿编码模型的查错修虫能力。结果显示,Claude Opus 4.8 (max) 单次运行修复 15 个 bug,而本地运行的 Qwen3.8-27B 8-bit 量化模型修复数量接近,且三次运行累计成绩可超过单次 Opus 4.8,显示本地开源模型在调试任务上已逼近顶尖闭源模型水平。

2026-09-17 ~ 2026-09-17 · 3 条相关