Bug Hunt Bench 实测:多轮运行显著提升小模型查虫率,强模型仅涨 1-2 分
PawelHuryn · x · 2026-09-15
Pawel Huryn 用自有订阅在 Bug Hunt Bench 上对前沿编码模型做盲评实测(105 个真实植入 bug,单一 prompt),并公开排行榜与成本对比。
关键发现:
- 多轮运行显著提升 bug 检出率,对较小模型和低 reasoning effort 尤其明显
- 但对强模型、高 effort 档位,多轮几乎不改变平均分(最多 1-2 分)
- 各 run 的成本按 API 等价计价,横轴差异约两百倍(对数轴展示);耗时差异不足七倍
- 排行榜支持按分数/成本/时间/覆盖率排序,每个 run 的完整注记与注意事项在 GitHub 的 run-notes.md 中
结论:小模型靠多轮投票可逼近大模型单轮表现,但大模型高配多轮收益有限,钱花在更强配置上更值。
所属事件:Bug Hunt Bench 实测:多轮运行显著提升小模型查虫率(2 条相关)→
「编程与Agent」频道最新
- 开发者 A/B 实测 i-have-adhd 插件:让 coding agent 回答更易扫读 — KhuyenTran16 · 2026-09-15
- 让 coding agent 直接用上 GPU:hf cli 新玩法一行命令调 Hugging Face 算力 — ben_burtenshaw · 2026-09-15
- Qdrant 实测:稠密向量+BM25+SPLADE 混合检索 SEC 财报 — qdrant_engine · 2026-09-15
- 切回 Opus 后 agent 近乎复刻 ElevenLabs 广告,几乎难辨真伪 — austin_malerba · 2026-09-15
- 让 GPT-6 Astra 把 Ruby on Rails 应用迁到 Hugo 的冒险 — kshirinkin · 2026-09-15
- Matt Pocock 推出 /retro:把编码规范问题固化为 lint 与 CI 检查 — mattpocockuk · 2026-09-15