仅改两个 API 设置,OpenAI 模型 ARC-AGI-3 分数飙升且算力大降
xiaohu · x · 2026-07-30
OpenAI 近期复盘了其模型在 ARC-AGI-3 评测中「考砸」的原因,发现核心问题出在跑模型的程序上:模型每步推理的私有思考被清空,且上下文溢出时直接删除历史记录,导致模型失去记忆。
他们仅调整了两个 API 设置便修复了该问题:
- 保留推理:通过 Responses API 传回上一次响应 ID,自动保留中间推理过程。
- 上下文压缩:开启 compaction,上下文满时压缩为摘要继续运行,而非直接丢弃开头。
这带来了显著效果:GPT-5.6 Sol 在公开题库的得分从 13.3% 飙升至 38.3%;同时大幅降低了推理成本,最高档位下每局输出 token 从 290 万骤降至 49 万(约六分之一)。
所属事件:优化测试框架让GPT-5.6在ARC-AGI-3跑分翻三倍(21 条相关)→
「编程与Agent」频道最新
- 硬核比喻:给大模型做上下文扩展就像做器官移植手术 — Sauers_ · 2026-07-30
- 研究表明智能体框架可大幅提升 LLM 组合泛化能力 — lateinteraction · 2026-07-30
- 实测 AI 编程 Agent 成本:开 PR 中位数约 27 美元 — zeeg · 2026-07-30
- 实测 Codex Micro:将成为智能体工作流核心组件 — rudrank · 2026-07-30
- Grok Build 更新:强化无头流式输出与工具调用支持 — XFreeze · 2026-07-30
- LlamaIndex 创始人:一两年内人类或将不再审查 AI 代码 — dotey · 2026-07-30