长程知识工作评测:GPT-6 Sol 1483 Elo,大幅落后 Sonnet 5.5
haider1 · x · 2026-09-29
博主 haider1 汇总了 GPT-6 Sol 在长程知识工作上的评测结果,表现堪忧:
- GPT-6 Sol: 1483 Elo,远低于 Claude 系列竞争对手
- Claude Sonnet 5.5: 1811 Elo,基本进入 Opus 级别
- Claude Opus 5.5: 1822 Elo,仍居榜首
结合其此前引用的 Terminal-Bench 结果,Sonnet 5.5 甚至在 Terminal-Bench 上超过 Opus 5.5,在知识工作与 computer use 上与其基本持平,而价格只有一半——Anthropic 这次把大部分 Opus 体验压缩进了 Sonnet 档位。GPT-6 Sol 在知识工作类任务上的差距被形容为 "brutal"。
「模型」频道最新
- 网传截图:Sonnet-5.5 评测分超 Astra,作者称难辨真伪 — adonis_singh · 2026-09-29
- 博主预测:中国模型两三个月内追平 Opus 5.5 且便宜 90% — rchardkovacs · 2026-09-29
- 网友调侃 OpenAI 预告:GPT-6 要等到 2025? — haider1 · 2026-09-29
- 实测称 Sonnet 5.5 表现不佳,建议 Anthropic 退役 Sonnet/Haiku — bindureddy · 2026-09-29
- AI 急诊诊断准确率 78%,主治医生仅约 30% — realmeetjames · 2026-09-29
- Bindu Reddy 吐槽 Sonnet 5.5 不如 Terra,仍推荐 DeepSeek Flash — bindureddy · 2026-09-29