GPT-6 Astra 通关 ARC-AGI-3 逐手复盘:交互式拆解 99.9%
GregKamradt · x · 2026-10-01
MTSlive 发布了一篇关于 ARC-AGI-3 的交互式深度报道,Greg Kamradt 转发推荐。
- ARC-AGI-3 由 ARC Prize Foundation 构建,要求模型进入陌生游戏、自行发现规则并学会高效通关。
- 该站让读者先亲手试玩其中一个公开环境(SK48),再解释分数背后的含义。
- 在 ARC Prize 的开源评测框架中,模型每回合收到的是纯文本:游戏状态、64×64 的 0-15 整数网格、合法动作列表,系统提示只有一句「你在玩游戏,目标是赢」。
- 2026 年 8 月 31 日,ARC Prize 记录 GPT-6 Astra 以最高推理强度在约 90 分钟内用 242 步 通关全部 8 关;每一歩都附带 Astra 写下的推理笔记,文中原样呈现。
- 复盘显示 Astra 在第 1 步就形成了规则假设(两个点要各自到达十字、灰色按钮组分别驱动两根条),随后用一次点击验证假设——尽管它从未「看到」颜色,却自行给对象命名区分。
Kamradt 评论称基准测试生态正日益成为衡量进展与能力透明度的重要标尺。
「模型」频道最新
- 注意力头间互通的 IHA 被 NeurIPS 接收,RULER 检索提升 10-20% — _arohan_ · 2026-10-01
- 开发者盛赞 Opus 5.5 状态输出:像资深工程师一样汇报进度 — sytelus · 2026-10-01
- 未专门训练的 d1 模型打出《任天堂明星大乱斗》高水准对战 — maximelabonne · 2026-10-01
- GPT-6 Astra 偏好 CDT 而非 EDT,与 Anthropic 模型决策理论倾向形成反差 — dfrsrchtwts · 2026-10-01
- OpenAI 向订阅用户免费开放 Luna,开发者称与更大模型差距已很小 — dosco · 2026-10-01
- 蚂蚁 Ling-3.1-flash 发布:560B参数25B激活,上下文冲上1M — Elouakili_Flexy · 2026-10-01