17款大模型战略推理实测:GPT-5.6 居首,Opus 4.8 仅列第五
petburiraja · reddit · 2026-07-22
一家私人机构发布了 17 款前沿大模型的综合基准测试结果。测试涵盖战略推理(30%)、咨询质量(25%)、长文分析(25%)和批判性审查(20%)四个维度。
核心排名:
- GPT-5.6 Sol high 以 96.5 分位居第一,Qwen 3.8 Max(95.0)和 GPT-5.6 Sol xhigh(93.8)紧随其后。
- Opus 4.8 获得 92.3 分位列第五,其咨询质量得分较高(96.7),但战略推理(87.0)相对拖后腿。
- Grok 4.5 总分 92.0,其战略推理拿到全场最高的 96.0,但批判性审查得分较低(83.2)。
测试局限: 每项测试仅运行一次(n=1),且部分模型由不同模型进行盲评打分,存在 ±3-5 分的误差。作者强调这仅是特定领域的业务测试,不代表模型的编程、视觉或长上下文能力。
「模型」频道最新
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用户呼声下 DeepSeek V4 Pro API 宣布继续服务,计费不变 — teortaxesTex · 2026-09-11
- 第三方实测:DeepSeek V4.1 Flash 达 GPT-6 Astra 98% 分,成本仅 1.4% — ayushtweetshere · 2026-09-11