博主实测:GPT-6-Sol xhigh 在 Codex 的 Boeing bench 表现平平
victormustar · x · 2026-09-23
博主 @victormustar 发帖称,在 Codex 中使用 GPT-6-Sol xhigh 模型跑 Boeing bench 成绩并不理想("not great")。帖内未附具体分数,仅给出截图链接,需以原图数据为准;这是一条对最新模型编码能力的早期负面反馈,可作为后续评测对比的线索。
「模型」频道最新
- 开发者称用 Opus 5.5 纯代码生成动画帧,效果震撼到其差点晕倒 — RileyRalmuto · 2026-09-23
- Kimi K3 等开源大模型或严重欠训练,数据 scaling 远未见顶 — zeeshanp_ · 2026-09-23
- 小米 MiMo V2.6 Pro/Flash 包揽 Vals Index 开源模型前二 — burny_tech · 2026-09-23
- 回头看 ChatGPT 3.5:记忆被美化,正如童年游戏的老旧画质 — flowersslop · 2026-09-23
- Opus 5.5 对比 Sol 6 一次性实测:差距大到出乎意料 — alvelda · 2026-09-23
- TestingCatalog 推出邮件版 AI 日报,爆料 GPT-6 与 Opus 5.5 同日发布 — testingcatalog · 2026-09-23