Bug Hunt Bench 编程模型实测榜更新:GPT-6.1 Sol xhigh 档近乎免费
PawelHuryn · x · 2026-09-30
Pawel Huryn 运营的 Bug Hunt Bench(让前沿编程模型修复真实仓库中预埋的 105 个 bug,盲评、单 prompt、按成本/时间/轮次多维度展示)更新:所有努力档位(effort levels)已就绪,补充运行(n=3)进行中。xhigh 档结果已出,其中 GPT-6.1 Sol 在 xhigh 下成本几乎为零。完整榜单、注意事项与各模型 run 说明在 bughunt.productcompass.pm 及其 GitHub(results/run-notes.md、runs.csv)。
所属事件:GPT-6.1 Sol 多项实测出炉:性能近 Astra、成本大幅更低(16 条相关)→
「模型」频道最新
- Gemini 4 Argon 在 AA Coding Agent Index 编码测试表现亮眼 — prateeky2806 · 2026-10-01
- Anthropic 评估:GLM-5.3 可自主构建 Chrome 漏洞利用,防护近乎为零 — matthew_d_green · 2026-10-01
- Artificial Analysis 公布 Solar Mini 4 完整智能指数测试结果 — ArtificialAnlys · 2026-10-01
- Upstage 发布 Solar Mini 4:3B 激活参数拿下 Intelligence Index 24 分 — ArtificialAnlys · 2026-10-01
- 红队测试 GLM 5.3 发现诡异输出,怀疑 OpenRouter 路由到 1bit 量化版 — voooooogel · 2026-10-01
- 谷歌员工自曝 Gemini 4 擅长长上下文:摄取与长序列生成都强 — RubenEVillegas · 2026-10-01