GPT-6 系列能力不及 GPT-5.6,首次出现代际升级反而变弱
srchvrs · x · 2026-09-24
Lech Mazur 在 Extended NYT Connections 基准(940 道加入干扰词的 NYT Connections 谜题)上评测发现:Opus 5.5、GPT-6 Sol 和 GPT-6 Luna 都比各自前代略弱但便宜得多。srchvrs 指出,这可能是现代史上首次大版本发布的新模型能力反而低于上一代——此前 GPT-3 到 GPT-4 等每次升级都带来显著能力提升。
「模型」频道最新
- Meta Muse 4 万评分达 4.88:产品、分发、价格三线碾压式竞争 — RihardJarc · 2026-09-24
- Audi 3D 建模实测:GPT-6 Astra 与 Opus 5.5 领跑 — kevinkern · 2026-09-24
- 重跑 Audi 3D 建模对比:只有 GPT-6 Astra 与 Opus 5.5 能打 — kevinkern · 2026-09-24
- 自建 200 题校准测试:模型自报 90% 把关可信度 — colinmcnamara · 2026-09-24
- Kev-9b 与 Decider-2b 实测:错题常自报 90% 把握 — colinmcnamara · 2026-09-24
- 仅反转选项顺序就改动 1/4 答案,模型差分有多脆 — colinmcnamara · 2026-09-24