105 个真实 bug 实测:Pareto 复合模型以 4.81 美元逼近 GPT-6 Astra
PawelHuryn · x · 2026-09-18
Pawel Huryn 发布 Bug Hunt Bench 最新横评:在 2 个真实仓库中埋入 105 个 bug(均为 2026 年初前沿模型开局难以解决的真 bug),盲评打分(同实验室模型互评被排除),比拼得分、成本与耗时。
- 得分与成本:GPT-6 Astra(max)45 分/$33.03;Fable 5.1(max)43 分/$77.55;Muse Spark 1.3(max)32.2 分/$18.11;Pareto(Unbiased,前 Union Alpha)30.7 分/$4.81;Grok 4.6(xhigh)28.7 分/$18.60;Opus 5(max)27 分/$51.33
- 亮点:Pareto 用不到 $5 的成本拿到 30.7 分,性价比突出,实测发现它是一个复合模型
- 全部成本差距约两百倍(对数轴展示),耗时差距不到七倍
- 榜单持续更新,数据与运行说明开源在 GitHub
结论:便宜的新兴模型在真实修 bug 任务上已能逼近最贵的前沿模型,但后者上限更高。
所属事件:Bug Hunt Bench 实测:Pareto 以 4.81 美元逼近顶级模型(2 条相关)→
「编程与Agent」频道最新
- ChatGPT 网页端配置后可直接给 GitHub 仓库提 PR — dotey · 2026-09-18
- Sakana 发布 Fugu Max:动态路由多模型编排,免费开放使用 — tkasasagi · 2026-09-18
- 无 Java SDK 也能用:单文件 Java 25 调通 TypeSafe Jev API — therealdanvega · 2026-09-18
- fast-jev-compaction:1 秒把 Claude 会话从 100 万 token 压到 8.6 万 — viksit · 2026-09-18
- Claude Code 2.1.276 更新明细:距上版不到 6 小时,提示词增 440 token — ClaudeCodeLog · 2026-09-18
- Claude Code 2.1.276 发布:修复代理网关下全部请求 400 的回归 — ClaudeCodeLog · 2026-09-18