OpenAI 优化 ARC-AGI-3 测试框架,分数提升 188%
OpenAI · x · 2026-07-30
OpenAI 发现 GPT-5.6 Sol 在 ARC-AGI-3 测试中表现不佳的原因是标准测试框架会在每步操作后丢弃模型的推理过程,并在上下文填满时丢失早期操作记录。
通过改用 Responses API 并开启保留推理与上下文压缩功能,模型能够积累学习经验。这使得 GPT-5.6 Sol 在公开测试集上的得分飙升了 188%,同时输出 token 的消耗量减少了 6 倍。
所属事件:GPT-5.6开启两项API设置后ARC-AGI-3得分飙升3倍(12 条相关)→
「编程与Agent」频道最新
- Kimi K3 递归自我改进 Cline,终端基准得分升至 88.8% — teortaxesTex · 2026-07-30
- BAIR 提出 ABBEL 框架:用自然语言「信念」优化长程智能体上下文 — berkeley_ai · 2026-07-30
- 观点:agentic推理应只在能增加价值的地方使用,而非不加区分 — srchvrs · 2026-07-30
- 15岁开发者建平台 Monet:让用户自带 AI 账号,开发者告别垫付 API 费 — awesomebirder · 2026-07-30
- Hugging Face 遭遇首例自主智能体网络攻击,公开防御细节 — EvanHub · 2026-07-30
- 专家点评 Vibe Coding:低风险场景好用,难撑企业级系统 — 2C_ornot2C · 2026-07-30