105 个植入 bug 实测:本地 Qwen3.8-27B 修虫量逼近 Claude Opus

PawelHuryn · x · 2026-09-17

作者用两个真实仓库、植入 105 个 bug 的基准实测本地 LLM 的找虫修虫能力。结果:Opus 4.8(max)修复 15 个,Qwen3.8-27B 8-bit 量化修复 10.7 个,Sonnet 5(high)9 个,Gemma 4 31B 仅 4 个,gpt-oss-120b 为 0(基本不可用)。

意外亮点是 Qwen3.8-27B 的 8-bit 量化版:仅约 28.6 GB,在 64 GB 内存 Mac mini 上即可流畅跑 200K 上下文。作者认为它虽不如顶级闭源模型聪明,但足以承担真实有用的日常修虫工作,且成本几乎只有电费。

所属事件:Bug Hunt Bench 实测:本地 Qwen3.8-27B 修虫能力逼近 Opus(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →