专为对抗 LLM 扩展设计的 ARC-AGI-3,据称已被前沿模型 Astra 饱和
mattturck · x · 2026-09-04
Matt Turck 转述并评论了一则引发热议的评测结果:ARC 系列评测本是为抵抗 LLM scaling 范式而设计的。o1 在 2024 年的早期推理模型时代在 ARC-AGI 上仅得 18%;更难的 ARC-AGI-3 于 2026 年上线后,前沿模型开局只有 0.5%;而现在据称模型 Astra 用其原生 harness "完全饱和"了这项测试。
Turck 称之为 "wild",并指向其播客中的相关讨论。若结果属实,意味着专为测试推理与泛化、对抗 scaling 而设计的基准已被最新前沿模型攻破,但对"饱和"的定义与 harness 口径仍需等待更正式的确认。
所属事件:GPT-6 Astra 刷爆 ARC-AGI-3,步数少于人类(5 条相关)→
「模型」频道最新
- Sam Altman 暗示 Astra 完整访问或本周末开放,本月或迎 3 次额度重置 — iruletheworldmo · 2026-09-04
- 分析师:至今没有非 NVIDIA 训练的模型能击败 NVIDIA 训练的模型 — BenBajarin · 2026-09-04
- 12 名 PhD 团队 Mostik 用潜空间通信登顶 ARC-AGI 榜 — VoidAsuka · 2026-09-04
- 开发者晒参与 OpenAI Astra 项目成果,称期待生态应用 — oyhsu · 2026-09-04
- Fable 5.1 给 agent 命名延续 Fable 5 风格,模型人格稳定性受关注 — repligate · 2026-09-04
- OpenAI 随 GPT-6 Astra 发布承诺 10 亿美元补贴网络安全防御 — EricBuess · 2026-09-04