ARC-AGI-3 实测:Claude Opus 凭持久状态记录碾压 GPT-5.6
otarU · reddit · 2026-08-01
一位开发者在 ARC-AGI-3 谜题中对比了 Claude Opus 5 High(得分 98.81%)与 GPT-5.6 Sol Max(得分 21.42%)的实际运行回放。由于测试框架只保留每轮对话的可见输出并丢弃隐藏的思考过程,模型如何利用可见输出维持记忆成为关键。
核心差异分析:
- 成绩对比:Opus 完成了全部 7/7 关卡,而 Sol 在第 4 关卡壳,仅完成 3/7。
- 状态追踪:Opus 在可见输出中保持了极其详细的“上下文笔记”,持续追踪坐标、假设和多步计划;而 Sol 的输出非常简短(中位数仅约 24 词,Opus 约 283 词),缺乏长效记忆,导致在第 4 关反复重置(8次)并陷入理解死循环。
- Token 消耗:尽管 Sol 的可见输出仅有 8,300 词(Opus 约 116,000 词),但其底层消耗了 228 万输出 Token(其中 226 万为推理 Token),Opus 则消耗 196 万 Token 且无单独计费的推理 Token。
结论指出:在长周期任务中,Opus 通过在可见输出中冗余地记录状态、假设和规划,成功克服了长程决策的遗忘问题;而 Sol 虽然单步响应更简练,却因缺乏持久状态表示而陷入死循环。
「模型」频道最新
- DeepSeek 推理过程惊呼"OH MY GOD",拟人化情绪出圈 — fragment_me · 2026-08-01
- 开发者吐槽 Claude 英文写作风格严重退化:满屏陈词滥调 — smolix · 2026-08-01
- Hugging Face 遭未公开闭源模型攻击,用开源模型成功防御 — _akhaliq · 2026-08-01
- 实测 DeepSeek V4 Flash:20万上下文不掉链,推理能力惊艳 — Nyghtbynger · 2026-08-01
- Gemini大更新:推出3.6 Flash模型,扩展智能体与多模态能力 — GeminiApp · 2026-08-01
- 多款热门大模型去审查版本发布,附本地部署工具链 — LLMFan46 · 2026-08-01