开发者吐槽:626 个测试全过,但测试质量堪忧
dyn___ · x · 2026-09-23
开发者 dyn 展示「626 tests pass」的截图,吐槽大量测试本身写得很烂,怀疑这种冗长输出要么是为了虚增 token 用量,要么是 RL 训练的副作用,希望 OpenAI 在下次发布中修复。
「模型」频道最新
- 早期实测:Opus的2D/3D图形能力媲美GPT-6 Astra — cedric_chee · 2026-09-23
- 早期测试者:Opus 5.5 修复写作问题,告别 AI 腔 — TheZvi · 2026-09-23
- 开发者初测 Opus 5.5:多任务表现出色,价格约为 Fable 三分之一 — doodlestein · 2026-09-23
- Opus 5.5 实测:速度提升 30%、单任务便宜 40%,Codex 用户回流 Claude — every · 2026-09-23
- 观点:先发旗舰后发中端模型是错误的发布顺序 — Angaisb_ · 2026-09-23
- Reddit 爆料:AA 榜指 GPT-6 Sol 表现失望,Opus 5.5 成全能选手 — queenofartists · 2026-09-23