GPT-6 Astra 在 ARC-AGI-3 关闭推理仍得 35.2%,较 GPT-5.6 高逾 4.5 倍
mhmazur · x · 2026-09-09
ARC 基金会的 mhmazur 公布 GPT-6 Astra 在 ARC-AGI-3 上的成绩,最惊人的一点是关闭推理(effort=none)时的表现:
- Standard harness(模型自行决定保留哪些笔记)下,Astra 在「none」得 35.2%,是「low」(17.5%)的近两倍,接近「medium」的 38.6%。
- 对比:八周前发布的 GPT-5.6 Sol 在「max」推理下仅得 7.8%;Astra 在「none」下得分是其 4.5 倍以上。
- 新的 Provider Adapter harness(保留不透明推理)下,Astra「none」得 96.7%,接近其他推理档位的 98.0%–99.9%。
作者感叹「none」推理档在早期测试可用但 API 目前已不再提供,并称 OpenAI 这次确实做得很出色。
所属事件:OpenAI 新模型 Astra 刷爆 ARC-AGI-3 基准(2 条相关)→
「模型」频道最新
- 博主实测 ChatGPT Images 2.5:信息图精准局部编辑 — xiaohu · 2026-09-09
- 用户实测:GPT-6 Astra 视频理解「100% 准确」,逐帧指认所有物体 — imjustnewatai · 2026-09-09
- Agent 打 Minecraft 该不该暂停思考?延迟或污染评测结果 — imjustnewatai · 2026-09-09
- OpenAI 发布图像模型 2.5:多轮指令与参考图保留更强 — Simon Willison · 2026-09-09
- 过度 RL 让模型变得字面化?CoT「粗人语」损害推理连贯性 — mike64_t · 2026-09-09
- 实测 Astra 玩约 30 款冷门解谜游戏,ARC-AGI-3 得分或被低估 — burny_tech · 2026-09-09