Bug Hunt Bench 用 105 个真实漏洞实测:模型成本相差近 200 倍
PawelHuryn · x · 2026-09-22
Pawel Huryn 发布 Bug Hunt Bench,用小米仓库中 105 个真实(非人造植入)漏洞实测前沿编程模型,由不同模型家族的盲评裁判对照密钥答案打分,未修复或漏判记 0 分。
首轮结果(得分/花费):
- Muse Spark 1.3 (max):32.2 分 / $18.11
- GPT-5.6 Luna (max):31.5 分 / $2.82
- Grok 4.7 (xhigh):28.8 分 / $22.89
- MiMo-V2.6-Pro (default):22.7 分 / $0.86
- DeepSeek V4.1 Flash (max):21.7 分 / $0.78
- Gemini 3.8 Flash (high):18 分 / $11.03
作者强调这些并非随机 bug,而是前沿模型在 2026 年初仍难以解决的问题;成本跨度约 200 倍,呈现明显 Pareto 前沿。榜单按“种植漏洞修复数”排序,完整注释与数据公开在 GitHub。
所属事件:Bug Hunt Bench 实测 105 个真实漏洞:模型成本相差近 200 倍(3 条相关)→
「编程与Agent」频道最新
- Kimi 浏览器扩展正式发布:侧边栏驱动网页,一次录制变可复用 Skill — Kimi_Moonshot · 2026-09-22
- JEVfire 开源:Qwen 0.8B 在浏览器里 71ms 一步通关超级马里奥 — ricklamers · 2026-09-22
- 创业者求荐:用 LLM 抓取小店优惠信息,Terra 太贵想换便宜模型 — ActionHungry · 2026-09-22
- simd 作者:一个夏天,AI 让六个成熟库大幅提速 — lemire · 2026-09-22
- Google 开源 agentic 编排运行时 ax,单日狂揽 2300+ Star — google · 2026-09-22
- treg 号称「Agent 工具的 OpenRouter」,统一管理 MCP 凭证与密钥 — superdesigndev · 2026-09-22