Bug Hunt Bench 实测:多轮运行显著提升小模型查虫率
Pawel Huryn 用自有订阅在 Bug Hunt Bench 上对前沿编码模型做盲评实测,基准包含 105 个真实植入 bug,采用单一 prompt,并公开排行榜与成本对比。关键发现显示多轮运行显著提升小模型的查虫率,而强模型仅提升 1-2 分。随后 Huryn 回应追问,澄清 Muse Spark 1.3 的成本按标准 API 计价(非贡献者价),并给出该模型的计价筛选链接。
2026-09-15 ~ 2026-09-15 · 2 条相关
- Bug Hunt Bench 实测:多轮运行显著提升小模型查虫率,强模型仅涨 1-2 分 — PawelHuryn · 2026-09-15
- Bug Hunt Bench 作者回应:Muse Spark 1.3 用标准 API 计价口径 — PawelHuryn · 2026-09-15