OpenAI 调整 API 设置,GPT-5.6 在 ARC-AGI-3 分数翻三倍
GregKamradt · x · 2026-07-30
OpenAI 内部测试发现,通过启用特定的 API 设置(由服务端管理对话状态),GPT-5.6 Sol 在处理 ARC-AGI-3 等长程任务时的表现得到显著提升,不仅分数翻了三倍,还减少了 6 倍的输出 token。
ARC Prize 官方对此回应称,这种“带框架”的测试方式确实能保持多轮对话的连续性并提升成绩。但为了保证各大厂商之间公平比较,ARC 官方榜单依然采用“无框架”标准:所有模型都在相同的观测条件、系统提示和动作限制下运行,且对话状态完全由客户端管理,以防止针对特定开发者的设置优化或意外作弊。目前 ARC 正与 OpenAI 等实验室探讨如何合理引入这些服务端设置。
所属事件:优化测试框架让GPT-5.6在ARC-AGI-3跑分翻三倍(19 条相关)→
「模型」频道最新
- 仅改两个 API 设置,OpenAI 模型 ARC-AGI-3 分数飙升且算力大降 — xiaohu · 2026-07-30
- OpenAI 确认遭泄露模型为内部研究原型,Altman 称其已被永久停用 — ChrisGPT · 2026-07-30
- 马斯克暗示 Grok 4.6 将迎来重大提升 — elonmusk · 2026-07-30
- 开发者吐槽开源模型 API:缺乏低价端点,期待落空 — arthurcolle · 2026-07-30
- Greg Kamradt 回应评测争议:Opus 与 OpenAI 采用相同滑动窗口 — GregKamradt · 2026-07-30
- Anthropic Opus 新版被指疯狂偷懒,自动化任务大幅缩水 — 歸藏的AI工具箱 · 2026-07-30