Bug Hunt Bench 实测:GPT-6 Sol 仅修 29/105,不如上代
ssh4net · x · 2026-09-25
- 第三方账号 StatsWire 称,在 Bug Hunt Bench 上,GPT-6 Sol 仅修复 105 个 bug 中的 29 个,而上一代 GPT-5.6 Sol 修复了 43 个。
- 结论:OpenAI 似乎同时降低了价格与能力,新模型更便宜但表现明显倒退(数据未经官方证实,属第三方评测爆料)。
所属事件:Bug Hunt Bench 实测 GPT-6:Astra 居首,Sol 版本大幅退化(2 条相关)→
「模型」频道最新
- 实测证明 RAG 分不清反义句,好模型不可替代 — galratner · 2026-09-25
- 用 Mistral 报税被多退 2 万美元?网友玩梗幻觉焦虑 — Rasmic · 2026-09-25
- 用户盛赞 Anthropic Opus 5.5:更聪明还便宜40%,配额都难用完 — altryne · 2026-09-25
- 业者指出:RL环境数据大量由闭源模型批量生成而非人工标注 — xeophon · 2026-09-25
- 实测称 Opus 5.5 让 Codex 转投用户回流 Claude,价格约为 Fable 四折 — every · 2026-09-25
- 博主表态:模型路由器是合理的方向 — Rasmic · 2026-09-25