Bug Hunt Bench 新数据:GPT-6 Astra 盲区与众不同,作者改用混合路由策略
PawelHuryn · x · 2026-09-05
开发者 PawelHuryn 的 Bug Hunt Bench(用真实植入 bug 的仓库盲测前沿编码模型,105 个 bug)公布新数据与说明:
- 核心发现:GPT-6 Astra 的盲点与其他模型完全不同,由此作者调整了工作流路由——实现用 Astra,代码审查用 Fable 或 Sol。
- 方法论要点:
- 不统计未植入的 bug,因为 OpenAI 模型会报告大量真实但不相关的「bug-maxing」问题;
- 所有 bug 都是 2026 年初前沿模型漏掉的真实 bug;
- 答案不公开,这正是该基准有效的原因;
- 成本横跨约 200 倍(对数轴),时间跨度不到 7 倍;
- 即将开源测试 harness,读者可用自己的仓库复现。数据与 JSON 文件公开。
所属事件:105 个真实 bug 实测:GPT-6 Astra 修 48 个夺冠(10 条相关)→
「编程与Agent」频道最新
- Tinker 开源配方:用强化学习训练校准的未来事件预测模型 — simonguozirui · 2026-09-05
- Grok Build 推送 v1.0.19 更新,由 Grok 4.6 驱动的编程 Agent 持续迭代 — elonmusk · 2026-09-05
- OpenAI 发布 GPT-6 Astra:电脑上能做的事它都能替你完成 — OpenAIDevs · 2026-09-05
- PowerShell PSAISuite:换一行模型名即可无缝切换新模型 — dfinke · 2026-09-05
- YC 公司 Pentagon 将推全新版本:云原生、真多人协作、面向长时自主工作 — edgarpavlovsky · 2026-09-05
- 一句话提示词让 UI 动起来:「别那么静态,加点弹性」 — lucasmeijer · 2026-09-05