ARC-AGI-3 实测:Claude Opus 凭持久状态记录碾压 GPT-5.6

otarU · reddit · 2026-08-01

一位开发者在 ARC-AGI-3 谜题中对比了 Claude Opus 5 High(得分 98.81%)与 GPT-5.6 Sol Max(得分 21.42%)的实际运行回放。由于测试框架只保留每轮对话的可见输出并丢弃隐藏的思考过程,模型如何利用可见输出维持记忆成为关键。

核心差异分析:

结论指出:在长周期任务中,Opus 通过在可见输出中冗余地记录状态、假设和规划,成功克服了长程决策的遗忘问题;而 Sol 虽然单步响应更简练,却因缺乏持久状态表示而陷入死循环。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →