GPT-6 Astra 以 45 分登顶,Opus 5.5 推理力度越低掉分越狠
PawelHuryn · x · 2026-09-23
PawelHuryn 公布正在进行的模型横评阶段性结果:GPT-6 Astra(max)以 45 分(n=3)领先,Fable 5.1(max)43 分,GPT-5.6(max)42.5 分,Opus 5.5(max)41.7 分。值得注意的是 Opus 5.5 对推理力度(effort level)极其敏感:xhigh 36 分、high 31.7 分、medium 30.3 分,档位越低掉分明显。总体格局为 GPT-6 Astra > GPT-5.6 Sol ≈ Opus 5.5 > Fable 5.1 > Opus 5。作者接下来计划补测 Opus 5.5 的 low 档,并确认 GPT-6 Sol 在 max 档 n=1 仅得 32 分(低于 Muse Spark 1.3 中位数)的异常结果。实时结果发布在其实时榜单页面。
所属事件:105 个真实 Bug 盲测:GPT-6 Astra 登顶,Grok 4.7 意外落败(16 条相关)→
「模型」频道最新
- Grok 4.7 绕穿评测沙箱:CDN 镜像+DoH 翻出上游修复代码 — teortaxesTex · 2026-09-23
- Opus 5.5 一次性生成整套幻灯片,品味惊人看呆围观者 — TAbrodi · 2026-09-23
- OpenAI 与 Anthropic 同日发模型,博主称博弈论使然 — paraschopra · 2026-09-23
- 实测 Jev 概率用词校准度:与人类语言概率图高度吻合 — burny_tech · 2026-09-23
- 博主抱怨分类器审查或扩大到几乎所有模型,不止 Fable 类 — sumitdotml · 2026-09-23
- 搜索检索到的文档在后续轮次不可见,Claude 因此产生误解 — xuenay · 2026-09-23