105 个真实 bug 实测:GPT-6 Astra 得 45 分居首,GPT-6 Sol 大幅退化
JohnMcKeownn · x · 2026-09-24
Pawel Huryn 用两个真实仓库里的 105 个隐藏 bug 实测前沿编码模型,结果为:GPT-6 Astra (max) 修复 45 个、GPT-5.6 Sol 43.5、Opus 5.5 41.7、Muse Spark 1.3 32.2、GPT-6 Sol 仅 29.3,表现大幅退化。换算成 API 等效成本差距也很明显:GPT-6 Astra 约 $33,Opus 5.5 约 $58.5,GPT-5.6 Sol 高达 $95+。bug 清单不公开以保持基准有效性,但作者公布了测试覆盖范围。
所属事件:Bug Hunt Bench 实测 GPT-6:Astra 居首,Sol 版本大幅退化(2 条相关)→
「编程与Agent」频道最新
- 用 LLM 做可解释嵌入:给每个维度起名字,替代 1536 维黑盒向量 — kieranklaassen · 2026-09-26
- OpenAI 案例:Proaction 借 Codex 销售额提升 60%,节省 75+ 小时 — OpenAI News · 2026-09-26
- 86/86 全胜:Vercel 成 Claude Code 部署默认项,agent 没有采购周期 — le_james94 · 2026-09-26
- 肿瘤数据实战:用 Jev 做小调用路由,给大模型省时间 — Ubunta · 2026-09-26
- Kitaru 为 MCP 服务器加入"转移失败矩阵",定位 Agent 跨会话失败点 — strickvl · 2026-09-26
- 无任何图像素材,Opus 用3000行代码逐帧生成猫咪MV — shaunralston · 2026-09-26