长程知识工作评测:GPT-6 Sol 1483 Elo,大幅落后 Sonnet 5.5

haider1 · x · 2026-09-29

博主 haider1 汇总了 GPT-6 Sol 在长程知识工作上的评测结果,表现堪忧:

结合其此前引用的 Terminal-Bench 结果,Sonnet 5.5 甚至在 Terminal-Bench 上超过 Opus 5.5,在知识工作与 computer use 上与其基本持平,而价格只有一半——Anthropic 这次把大部分 Opus 体验压缩进了 Sonnet 档位。GPT-6 Sol 在知识工作类任务上的差距被形容为 "brutal"。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →