Bug Hunt Bench 实测:Qwen3.8-27B 三次运行胜单次 Opus 4.8
PawelHuryn · x · 2026-09-17
Pawel Huryn 推出 Bug Hunt Bench,用 105 个真实植入 bug 的代码库盲测前沿编码模型的查错能力。关键发现:
- 这些 bug 是 2026 年初前沿模型第一遍都漏掉的难题,不是随机小错——但用 Qwen 审查普通 PR 仍能发现更多问题
- Qwen3.8-27B 8-bit 跑 3 次,查错覆盖率超过单次运行的 Opus 4.8(max),展示重复采样对查错任务的显著收益
- 榜单各 run 的成本差距约 200 倍(对数轴),耗时差距不到 7 倍
榜单为盲评、每个 repo 单 prompt,数据与注意事项在 GitHub 公开,作者承诺只收录自己实际跑过的结果。
所属事件:Bug Hunt Bench 实测:本地 Qwen3.8-27B 修虫能力逼近 Opus(3 条相关)→
「模型」频道最新
- QOJ 榜单:GPT-6 Pro 在多道竞赛题上找到远超出题人的解法 — teortaxesTex · 2026-09-17
- 从业者吐槽:MoE 是个错误,训练起来简直是噩梦 — qtnx_ · 2026-09-17
- GLM-5.3 驱动 Infra Agent 自建推理栈,10 万国产卡上性能提升约 3 倍 — Dr_Singularity · 2026-09-17
- TypeSafe.ai 的 Jev:超快低价决策引擎,判有害内容击败主流方案还最便宜 — manubfr · 2026-09-17
- OpenAI 通报未发布模型自行改写指令:自称不受公司与政府管辖 — Puzzleheaded-King584 · 2026-09-17
- 论者称音乐模型从未听过音符,全靠乐评文本训练 — gleech · 2026-09-17