Bug Hunt Bench 编程模型实测榜更新:GPT-6.1 Sol xhigh 档近乎免费

PawelHuryn · x · 2026-09-30

Pawel Huryn 运营的 Bug Hunt Bench(让前沿编程模型修复真实仓库中预埋的 105 个 bug,盲评、单 prompt、按成本/时间/轮次多维度展示)更新:所有努力档位(effort levels)已就绪,补充运行(n=3)进行中。xhigh 档结果已出,其中 GPT-6.1 Sol 在 xhigh 下成本几乎为零。完整榜单、注意事项与各模型 run 说明在 bughunt.productcompass.pm 及其 GitHub(results/run-notes.md、runs.csv)。

所属事件:GPT-6.1 Sol 多项实测出炉:性能近 Astra、成本大幅更低(16 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →