GPT-6 Sol 实测翻车:105 个隐藏 bug 只修 29.3 个,垫底全场
PawelHuryn · x · 2026-09-23
作者用两个真实仓库、共 105 个隐藏 bug 对主流模型做了找 bug+修复实测,GPT-6 Sol 表现大幅退化:
- GPT-6 Astra (max):45 分
- GPT-5.6 Sol (max):43.5 分
- Opus 5.5 (max):41.7 分
- Muse Spark 1.3 (max):32.2 分
- GPT-6 Sol (max):29.3 分,垫底
但按 API 等价成本折算后格局反转:GPT-6 Sol 仅 $9.93,是 GPT-5.6 Sol($95.25)的约十分之一;GPT-6 Astra $33.04,Opus 5.5 $58.53,Muse Spark 1.3 $18.11。作者表示今天会在推文串里补充 xhigh/high/medium/low 各努力档位的更多数据。
所属事件:Bug Hunt Bench 实测:GPT-6 登顶,MiMo 性价比惊艳(18 条相关)→
「模型」频道最新
- Claude Opus 5.5 一次提示词写出生成 90 年代风格 demoscene 演示 — PurzBeats · 2026-09-24
- 曝 OpenAI 效率布局:GPT-6 Luna 主打性价比,Sol 低价保留多数智能 — haider1 · 2026-09-24
- 网传「Claude Opus 5.5 对 ChatGPT 6 Astra」对比视频,模型名存疑 — balianone · 2026-09-24
- 拍 4 张白板照片,Astra 一次完成识别、OCR 并矢量化 — iskander · 2026-09-24
- 用户实感:Claude 额度机制生变,本周主要被 Opus 限额卡住 — rudrank · 2026-09-24
- 用户质疑 OpenAI 用 Sol 换皮 Terra 降价却砍用量额度 — RexDouglass · 2026-09-24