105 个埋 bug 实测:Qwen3.8-27B 三次运行超过单次 Opus 4.8
PawelHuryn · x · 2026-09-17
作者 PawelHuryn 在 2 个真实代码库中埋入 105 个 bug,实测本地 LLM 的「查找并修复」能力。单次运行成绩:Opus 4.8 (max) 找出 15 个,Qwen3.8-27B 8-bit 为 10.7,Sonnet 5 (high) 为 9,Gemma 4 31B 仅 4,gpt-oss-120b 一个都找不到(基本不可用)。
最大惊喜是 Qwen3.8-27B:该模型 8-bit 量化版约 28.6 GB,200K 上下文可在 64 GB 的 Mac mini 上舒适运行,且连续跑 3 次累计超过单次 Opus 4.8 (max) 的成绩——作者认为这是本地模型在真实工程任务上的有力证据。
所属事件:Bug Hunt Bench 实测:本地 Qwen3.8-27B 修虫能力逼近 Opus(3 条相关)→
「编程与Agent」频道最新
- 企业 AI 落地案例:自托管客服 agent 答对 59/60 题,周省 15 小时 — alex_verem · 2026-09-17
- Synthesia 推出交互式数字人 API:自带 LLM,每用户送 500 分钟 — synthesiaIO · 2026-09-17
- MiniMax Design 接管本地 Blender:MCP 连接器七步搭建教程 — iamfakhrealam · 2026-09-17
- 一条提示词全流程建 3D 场景:MiniMax Design 接管 Blender 实操教程 — iamfakhrealam · 2026-09-17
- 四模型接力写作实验:ChatGPT 起草、三模型层层审稿全公开 — AggressiveGift1532 · 2026-09-17
- Matt Pocock 的 agent skills 仓库半年星数超 React,谈 AI 编码时代教学 — mattpocockuk · 2026-09-17