PINNACLE 评测:GPT-6 Sol 拉满思考力错误降 2.5 倍,Claude Opus 5.5 无效

ryanshrout · x · 2026-09-25

分析师 Patrick Moorhead 转发 PINNACLE 基准的对比评测,断言 Claude Opus 5.5 Max 相比 GPT-6 Sol Max 表现很差:每个正确任务成本高 1.8 倍、编造率多 68%,完成率仅多 0.4%,原因在于 Opus 5.5 需要 3 倍输出 token 才能得到正确答案。

PINNACLE 在相同多步企业任务、相同 128K 检索语料、按列表价计费下,对模型在默认(中等)与最大推理力度各测一轮:

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →