GPT-6 Astra 满分通关 25 款 ARC-AGI-3 游戏,最优率达 80%
i_dg23 · x · 2026-09-13
- Mike Knoop 转发讨论 RSI(递归自我改进)与智能的上限问题:智能并非无上限标量,任何情境都存在最优决策,智能可衡量为「决策质量/最优决策」之比,封顶 100%。
- 引用数据:在 25 款 ARC-AGI-3 公开游戏上,GPT-6 Astra(新 provider adapter harness)拿到 100% 得分;进一步对比人工基线动作数与已知最少动作通关,Astra 在 speedrun 意义上已达约 80% 最优。
- Knoop 认为 RSI 近期最有价值的两个方向:一是横向数据获取——模型受权重内知识限制,自动生成/收集数据可加速填补知识空白;二是效率与成本——当前离最优还远,适合 auto-research,且模型更便宜会反过来加速 auto-research。
「模型」频道最新
- 实测对比:Opus 一次成型质量胜 Astra,后者快 4 倍省 10 倍 token — chaseleantj · 2026-09-13
- Muse Spark 1.3 首批实测:鹈鹕骑自行车翻车,疑似未刷榜 — teortaxesTex · 2026-09-13
- Hermes 跑 DeepSeek 突然自己开程序「三声发声」,用户直呼瘆人 — Teknium · 2026-09-13
- OpenAI 一周:自动研究实习生达标、Navier-Stokes 被代理攻克 — btibor91 · 2026-09-13
- GPT-6 Astra 首超人类无人机基线,Vending-Bench 收入近 Claude 三倍 — The Decoder · 2026-09-13
- 本地跑大模型怎么选:四大开源模型家族的实战选型指南 — anant94 · 2026-09-13