ARC-AGI 揭秘:推理 Token 越多越容易跑偏,GPT-5.6 Max 反而更省钱
GregKamradt · x · 2026-08-08
Greg Kamradt 引用了 ARC Prize 官方对推理模型测试中“锯齿状”成本曲线的深度技术分析。研究发现,更高的推理性能往往伴随着更低的成本,这与直觉相悖。
官方解释称,处于最高推理模式(Max)的模型实际上比高推理模式消耗的 Token 更少。原因在于:
- High 模式经常在消耗大量 Token 后,依然沿着错误的假设深入推导,最终无法产出有效预测。
- Max 模式能够更早地结合关键规则(如颜色守恒),精准命中正确答案。
例如在 ARC-AGI-2 的一项任务中,High 模式耗费 9.8 万 Token 构建了复杂的错误理论,而 Max 模式仅用 7.6 万 Token 就得出了正确结论。这也印证了 DeepSeek 在该测试中展现出的极高性价比。
所属事件:DeepSeek V4 Flash登顶ARC-AGI性价比前沿(2 条相关)→
「模型」频道最新
- 吐槽模型太聪明:Opus 5.0 表现得像个固执的资深科学家 — sokrypton · 2026-08-08
- OpenAI 称即将发布的 Astra(GPT-6) 为首个网安关键模型 — Endonium · 2026-08-08
- 实测 Claude Opus 5:文案获赞,但前端排版仍难交付 — yuwen_lu_ · 2026-08-08
- OpenAI 因安全顾虑暂停 Astra 模型开发 — The Verge AI · 2026-08-08
- 仅 8MB 的静态嵌入模型 Lattice:7 分钟跑完英文维基百科 — vanstriendaniel · 2026-08-08
- Agent Arena 实测:Opus 系列性能提升伴随 token 暴涨 — arena · 2026-08-08