Bug Hunt Bench 用 105 个真实埋入 Bug 排名前沿编程模型
PawelHuryn · x · 2026-09-10
- Pawel Huryn(The Product Compass 作者)运营的 Bug Hunt Bench 是一个针对前沿编程模型的基准:在真实代码库中人为埋入 bug,让各模型修复,按修复数量(共 105 个)盲评排名,每仓库一次 prompt,评分盲化以减少污染。
- 排行榜支持按分数、成本、耗时、覆盖率多个维度查看;成本轴采用对数刻度,各模型间成本差距约两百倍,而耗时差距不到七倍。
- 帖子回复澄清:deepseek-v4-pro 相关运行已在队列中,等待两次运行(含一次重跑)完成后自动发布;作者指出某模型其实已被测过,只是未在默认筛选中显示。
所属事件:Bug Hunt Bench实测105个真实Bug,DeepSeek性价比亮眼(5 条相关)→
「模型」频道最新
- 实测:Google AI Mode 未登录用户引用来源三周内锐减 72% — gaganghotra_ · 2026-09-10
- DeepSeek 自曝 CED 架构灵感来自 2024 年 YoCo 论文 — jm_alexia · 2026-09-10
- DeepSeek 效率研究将成本压降超 10 倍,架构成降价唯一数学变量 — ChengleiSi · 2026-09-10
- DeepSeek 发布非对称新架构:552B MoE,输入仅激活 8B — ChengleiSi · 2026-09-10
- 13 步手推 Switch Transformer:看懂 MoE 为何省算力 — ProfTomYeh · 2026-09-10
- Gemini V4.1 预训练算力估算:约 5e24 FLOPs,4K 块 B300 两周可跑完 — teortaxesTex · 2026-09-10