Bug Hunt Bench 放榜:105 个真实埋 bug 横评前沿编码模型
PawelHuryn · x · 2026-09-11
Pawel Huryn 推出 Bug Hunt Bench,一个针对前沿编码模型的 bug 排查基准:在真实仓库中人工埋入 105 个 bug,盲评打分,每个仓库只用一个 prompt,持续更新排行榜。
- 榜单同时给出分数-成本与分数-耗时两个视角:各 run 的成本相差约 200 倍,故成本轴采用对数刻度;耗时差距不到 7 倍,用线性轴即可诚实呈现。
- 支持「天花板 run」筛选、按实验室取最优、导出 PNG 等视图;不同推理档位/harness 的同一模型可多次上榜,历史 run 标记 superseded 不进默认视图。
- 作者另附一条按 OpenAI 全系模型筛选的视图链接,回应网友「Terra xhigh 档位在哪」的疑问(该项其实存在,只是被默认筛选器隐藏)。
所属事件:Bug Hunt Bench 横评:DeepSeek V4.1 Flash 高性价比亮眼(10 条相关)→
「模型」频道最新
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11
- Opus 以"安全"为由拒碰蛋白质生成代码,开发者吐槽误伤 — josephdviviano · 2026-09-11
- 网友称 DeepSeek 4.1 Flash 是语言模型历史拐点(未证实) — himanshustwts · 2026-09-11
- Terminal Bench v4 榜单:GLM-5.3 以 41.9% 一骑绝尘 — Ok_Warning2146 · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11