GPT-6 Astra 以 45 分登顶,Opus 5.5 推理力度越低掉分越狠

PawelHuryn · x · 2026-09-23

PawelHuryn 公布正在进行的模型横评阶段性结果:GPT-6 Astra(max)以 45 分(n=3)领先,Fable 5.1(max)43 分,GPT-5.6(max)42.5 分,Opus 5.5(max)41.7 分。值得注意的是 Opus 5.5 对推理力度(effort level)极其敏感:xhigh 36 分、high 31.7 分、medium 30.3 分,档位越低掉分明显。总体格局为 GPT-6 Astra > GPT-5.6 Sol ≈ Opus 5.5 > Fable 5.1 > Opus 5。作者接下来计划补测 Opus 5.5 的 low 档,并确认 GPT-6 Sol 在 max 档 n=1 仅得 32 分(低于 Muse Spark 1.3 中位数)的异常结果。实时结果发布在其实时榜单页面。

所属事件:105 个真实 Bug 盲测:GPT-6 Astra 登顶,Grok 4.7 意外落败(16 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →