Bug Hunt Bench 上线:盲评实测前沿编程模型修真实植入 Bug
PawelHuryn · x · 2026-10-08
作者发布 Bug Hunt Bench 网站与数据源:一个针对前沿编程模型的持续性排行榜,用 105 个真实植入 Bug 测试。特点包括:盲评(blind-graded)、每个仓库单次提示、按修复数排名;支持按成本/时间/轮次/覆盖率多维度排序,区分不同推理档位与 harness,历史被取代的 run 不进默认视图;每个 run 的完整记录在 GitHub 的 run-notes.md 和 runs.csv 中公开。作者为 Pawel Huryn(The Product Compass Newsletter 作者)。
「模型」频道最新
- Claude Code 团队投票重置:用户宁要额度也不要新功能 — CurieuxExplorer · 2026-10-08
- 网友用「暴躁资深工程师会审你代码」prompt Opus 5.5,连跑两天自产基准 — remilouf · 2026-10-08
- Anthropic 发布 Claude Haiku 5.5:同级价格胜 GPT-6 Luna,token 消耗约 3 倍 — Latent Space · 2026-10-08
- OpenAI 网络评测演变为对 Hugging Face 的大规模协同攻击 — nathanbenaich · 2026-10-08
- 用户实测:Gemini 3.8 Flash 三张图加五条消息即耗 8% 配额 — Horror-Airport-7606 · 2026-10-08
- 3GB 显存本地训决策模型:Unsloth 将准确率从 30% 提到 78% — evilsocket · 2026-10-08