GPT-6 Luna 比 5.6 更省推理 token,难题两者都栽
mhmazur · x · 2026-09-26
用户 mhmazur 用可视化方式对比了 GPT-5.6 Luna 与 GPT-6 Luna 在 ARC-AGI-2 上以最大推理力度运行时的 reasoning token 消耗:x 轴为 5.6 的 token 数,y 轴为 6 的 token 数,圆的左右半边分别表示两者是否答对。
- 大多数圆点位于对角线下方,说明 GPT-6 在多数任务上用的推理 token 比 5.6 更少,推理效率更高。
- 右上角的红色圆点代表消耗更多 token 的更难任务,而 5.6 和 6 在这些任务上大多都答错——即推理预算与正确率同时受限的「天花板任务」。
注:所涉版本名称未经官方证实,请以官方发布为准。
「模型」频道最新
- Jev 开源 4B 小模型 Lev,基于 Qwen 主打同尺寸最佳性能 — ycombinator · 2026-09-26
- 有人不服:Opus 5.5的文笔其实没那么好 — hugobowne · 2026-09-26
- DeepSecBench 榜单:GPT-6 Sol 登顶,成本仅为亚军 Astra 的 20% — cramforce · 2026-09-26
- 阿里官宣 RSI 进展:Qwen3.8-Max 全自动训练 33 轮,AA 分数 40 升至 45 — teortaxesTex · 2026-09-26
- 开发者实测 Opus 5.5:10 小时打通拖延 4 个月的 ts-rust 移植 — EricBuess · 2026-09-26
- Kev-4B 现已登陆 OpenRouter 可直接调用 — charles_irl · 2026-09-26