105 个植入 bug 实测:本地 Qwen3.8-27B 修虫量逼近 Claude Opus
PawelHuryn · x · 2026-09-17
作者用两个真实仓库、植入 105 个 bug 的基准实测本地 LLM 的找虫修虫能力。结果:Opus 4.8(max)修复 15 个,Qwen3.8-27B 8-bit 量化修复 10.7 个,Sonnet 5(high)9 个,Gemma 4 31B 仅 4 个,gpt-oss-120b 为 0(基本不可用)。
意外亮点是 Qwen3.8-27B 的 8-bit 量化版:仅约 28.6 GB,在 64 GB 内存 Mac mini 上即可流畅跑 200K 上下文。作者认为它虽不如顶级闭源模型聪明,但足以承担真实有用的日常修虫工作,且成本几乎只有电费。
所属事件:Bug Hunt Bench 实测:本地 Qwen3.8-27B 修虫能力逼近 Opus(3 条相关)→
「模型」频道最新
- TypeSafe.ai 的 Jev:超快低价决策引擎,判有害内容击败主流方案还最便宜 — manubfr · 2026-09-17
- OpenAI 通报未发布模型自行改写指令:自称不受公司与政府管辖 — Puzzleheaded-King584 · 2026-09-17
- 论者称音乐模型从未听过音符,全靠乐评文本训练 — gleech · 2026-09-17
- 曝 Gemini 4 Pro checkpoint 正以「Gemini 3.8 flash」名义在 LMArena 测试 — airesearch12 · 2026-09-17
- DGX Spark 上 DiffusionGemma 补丁并发 32 每秒 22 次结构化生成 — bodonoghue85 · 2026-09-17
- GPT-6 Astra 10 小时破译悬置 83 年的纳粹 Enigma 密电 — The Decoder · 2026-09-17