Bug Hunt Bench 实测:Qwen3.8-27B 三次运行胜单次 Opus 4.8

PawelHuryn · x · 2026-09-17

Pawel Huryn 推出 Bug Hunt Bench,用 105 个真实植入 bug 的代码库盲测前沿编码模型的查错能力。关键发现:

榜单为盲评、每个 repo 单 prompt,数据与注意事项在 GitHub 公开,作者承诺只收录自己实际跑过的结果。

所属事件:Bug Hunt Bench 实测:本地 Qwen3.8-27B 修虫能力逼近 Opus(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →