PINNACLE 评测:GPT-6 Sol 拉满思考力错误降 2.5 倍,Claude Opus 5.5 无效
ryanshrout · x · 2026-09-25
分析师 Patrick Moorhead 转发 PINNACLE 基准的对比评测,断言 Claude Opus 5.5 Max 相比 GPT-6 Sol Max 表现很差:每个正确任务成本高 1.8 倍、编造率多 68%,完成率仅多 0.4%,原因在于 Opus 5.5 需要 3 倍输出 token 才能得到正确答案。
PINNACLE 在相同多步企业任务、相同 128K 检索语料、按列表价计费下,对模型在默认(中等)与最大推理力度各测一轮:
- GPT-6 Sol 拉满思考力度:加权错误比中等力度少 2.5 倍(Model Score 从 3,998 升至 9,853),多步任务完成率 99.6%(中等为 96.8%),编造率从 7.9% 降到 2.9%。
- 成本:每个正确任务 29 美分 vs 16 美分(1.8 倍),落在成本前沿之上,高于 Grok 4.6、Claude Fable 5.1 与中等力度的 GPT-6 Astra。
- 关键差异:调高思考力度对 GPT-6 系列 agent 能力提升明显,对 Claude Opus 5.5 则没有效果。
「模型」频道最新
- 数学基准新榜:Astra 一骑绝尘,Fable 5.1 以下无人能打 — teortaxesTex · 2026-09-25
- 网友晒出全部 Claude 模型的测试结果对比 — repligate · 2026-09-25
- 鹈鹕骑车捕鱼 3D 游戏开源:一句提示词零手工改动可自行验证 — EricBuess · 2026-09-25
- 为 4 岁女儿一句提示词,Opus 5.5 生成 3D 绘本农场游戏 — EricBuess · 2026-09-25
- 黑猫夜行跳跃游戏 CatWalk:Opus 5.5 一次成型,唯一改动是调低音效 — EricBuess · 2026-09-25
- 日本开发者一条提示词做鱼叉捕鱼游戏,仅花 3000 円套餐 16% 额度 — EricBuess · 2026-09-25