Bug Hunt Bench 用 105 个真实漏洞实测:模型成本相差近 200 倍

PawelHuryn · x · 2026-09-22

Pawel Huryn 发布 Bug Hunt Bench,用小米仓库中 105 个真实(非人造植入)漏洞实测前沿编程模型,由不同模型家族的盲评裁判对照密钥答案打分,未修复或漏判记 0 分。

首轮结果(得分/花费):

作者强调这些并非随机 bug,而是前沿模型在 2026 年初仍难以解决的问题;成本跨度约 200 倍,呈现明显 Pareto 前沿。榜单按“种植漏洞修复数”排序,完整注释与数据公开在 GitHub。

所属事件:Bug Hunt Bench 实测 105 个真实漏洞:模型成本相差近 200 倍(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →