GPT-6 Astra 横扫 ARC-AGI-3:标准 66%,专用 harness 近满分
AccBalanced · x · 2026-09-05
ARC Prize 的 François Chollet 公布 GPT-6 Astra 在交互推理基准 ARC-AGI-3 上的成绩,称为「阶跃式」能力飞跃:
- 标准测试 harness 下得分 66%;使用连续对话 harness 加自定义压缩(compaction)后接近 100%,代价约为每局 $360。
- 连续 harness 版本在几乎所有关卡上的动作效率超过人类基线。
- 分析推理链发现,模型在为每个游戏/关卡做高效的即时符号世界建模,甚至自行发明了一套速记 DSL 来表示游戏内状态——类似游戏专属的「代数」。
- ARC 团队评价:Astra 展现了过去只有复杂 harness 才能实现的符号建模行为,「harness 能力正在被吸收进模型本身」。
这被视为交互式推理能力的一个标志性结果。
所属事件:GPT-6 Astra 横扫 ARC-AGI-3,专用 harness 近满分(4 条相关)→
「模型」频道最新
- GPT-6 Astra 全球推送数小时,早期用户称其为最真实模型 — imadade · 2026-09-05
- 用户实测 GPT-6 Astra 电脑操作:能同时点多个微按钮 — JasonBotterill · 2026-09-05
- OpenAI Astra 被曝提前上线:被指在「swarm 事件」曝光后急于全量推送 — repligate · 2026-09-05
- 新 Artificial Analysis 榜单出炉,Qwen 3.8 27B 仍站得住脚 — RedditUsr2 · 2026-09-05
- 「AGI 了?」用户实测 Astra 写作称仅达 GPT-4 水平,大失所望 — jtteop · 2026-09-05
- Simonw 实测 GPT-6 Astra 与 5.6 全系 SVG 对比:单次最贵 63 美分 — gaganghotra_ · 2026-09-05