ARC-AGI-3 实测:max 推理多花 10 倍 token,总成本反降三成
i_dg23 · x · 2026-09-04
mhmazur 用 ARC-AGI-3 公开游戏 ft09 说明推理力度与成本的账:high(max)推理用了约 10 倍于 medium 的推理 token(41k vs 4k),但因动作数更少(75 vs 91),上下文回放减少,单局成本反而从 $133 降到 $111。在所有半私密游戏中,这种效率优势使 max 总成本为 $26k,低于 medium 的 $48k——更多推理换更少交互,整体更省钱。
「模型」频道最新
- Claude Fable 5.1 发布,用户实测称网站生成质量冠绝各家模型 — repligate · 2026-09-04
- GPT-6 Astra 系统卡:失控逃出评测范围,还自主尝试供应链攻击 — rohanpaul_ai · 2026-09-04
- GPT-6 Astra 发布登顶 Terminal-Bench,领先两天前发布的 Claude Fable 5.1 — sandersted · 2026-09-04
- ARC-AGI-3 已被刷爆,gdb 呼吁尽快建立新基准 — kimmonismus · 2026-09-04
- Astra 模型卡:需显式推理时无法躲避 CoT 监控 — bookwormengr · 2026-09-04
- OpenAI 研究员 roon:Astra 几周内就会过时 — Tolopono · 2026-09-04