Bug Hunt Bench 实测:多轮运行显著提升小模型查虫率,强模型仅涨 1-2 分

PawelHuryn · x · 2026-09-15

Pawel Huryn 用自有订阅在 Bug Hunt Bench 上对前沿编码模型做盲评实测(105 个真实植入 bug,单一 prompt),并公开排行榜与成本对比。

关键发现:

结论:小模型靠多轮投票可逼近大模型单轮表现,但大模型高配多轮收益有限,钱花在更强配置上更值。

所属事件:Bug Hunt Bench 实测:多轮运行显著提升小模型查虫率(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →