专为对抗 LLM 扩展设计的 ARC-AGI-3,据称已被前沿模型 Astra 饱和

mattturck · x · 2026-09-04

Matt Turck 转述并评论了一则引发热议的评测结果:ARC 系列评测本是为抵抗 LLM scaling 范式而设计的。o1 在 2024 年的早期推理模型时代在 ARC-AGI 上仅得 18%;更难的 ARC-AGI-3 于 2026 年上线后,前沿模型开局只有 0.5%;而现在据称模型 Astra 用其原生 harness "完全饱和"了这项测试。

Turck 称之为 "wild",并指向其播客中的相关讨论。若结果属实,意味着专为测试推理与泛化、对抗 scaling 而设计的基准已被最新前沿模型攻破,但对"饱和"的定义与 harness 口径仍需等待更正式的确认。

所属事件:GPT-6 Astra 刷爆 ARC-AGI-3,步数少于人类(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →