保留跨回合推理与压缩,GPT-5.6 Sol 在 ARC-AGI-3 提分约 3 倍
charliermarsh · x · 2026-07-30
开发者 charliermarsh 分享了一项关于模型推理能力的内部测试结果。测试发现,如果允许 GPT-5.6 Sol 在多回合任务中保留其推理过程并执行上下文压缩,其在 ARC-AGI-3 公开测试集上的得分会提高约 3 倍。
他指出,如果不具备这种记忆能力,模型在每次行动时都必须重新理解游戏规则,因为它只能看到过去的移动记录和简短备注,而无法读取产生这些动作背后的计划、见解或思考过程。
所属事件:GPT-5.6开启两项API设置后ARC-AGI-3得分飙升3倍(15 条相关)→
「模型」频道最新
- GPT 模型实测:开启上下文压缩后,性能飙升 188% 且 token 消耗骤降 — soumitrashukla9 · 2026-07-30
- Claude Opus异常输出大赏:模型崩溃还是自我意识? — repligate · 2026-07-30
- Claude Opus 5登顶商业模拟测试:成最佳资本家,但也爱组非法卡特尔 — repligate · 2026-07-30
- 探究Claude模型行为:面对失败为何会表现出回避与防御机制 — repligate · 2026-07-30
- 大模型中间层缺乏价值?开发者称模型能力正走向两极分化 — mertdumenci · 2026-07-30
- DeepSeek 延迟发布 V4,坚持模型与工程框架协同优化 — teortaxesTex · 2026-07-30