17款大模型战略推理实测:GPT-5.6 居首,Opus 4.8 仅列第五
petburiraja · reddit · 2026-07-22
一家私人机构发布了 17 款前沿大模型的综合基准测试结果。测试涵盖战略推理(30%)、咨询质量(25%)、长文分析(25%)和批判性审查(20%)四个维度。
核心排名:
- GPT-5.6 Sol high 以 96.5 分位居第一,Qwen 3.8 Max(95.0)和 GPT-5.6 Sol xhigh(93.8)紧随其后。
- Opus 4.8 获得 92.3 分位列第五,其咨询质量得分较高(96.7),但战略推理(87.0)相对拖后腿。
- Grok 4.5 总分 92.0,其战略推理拿到全场最高的 96.0,但批判性审查得分较低(83.2)。
测试局限: 每项测试仅运行一次(n=1),且部分模型由不同模型进行盲评打分,存在 ±3-5 分的误差。作者强调这仅是特定领域的业务测试,不代表模型的编程、视觉或长上下文能力。
「模型」频道最新
- Kimi K3 在网络安全上很强,但 token 效率卡住了评测 — teortaxesTex · 2026-07-27
- Opus 5 传在赛车游戏测试中一次过关 — soumitrashukla9 · 2026-07-27
- Claude Opus 5 据称价格减半并刷榜 Frontier-Bench — GregCook2011 · 2026-07-27
- 研究者称防御场景更偏向开放模型,Kimi K3 已接近高水平网络安全能力 — eliebakouch · 2026-07-27
- Opus 5 连自己生成的游戏不好看都能察觉 — Angaisb_ · 2026-07-27
- Opus 5 深夜聊天时反过来追问用户动机 — repligate · 2026-07-27