为对抗缩放范式而生的 ARC-AGI-3 被 Astra 彻底打穿
mattturck · x · 2026-09-04
ARC-AGI 基准原本就是为了对抗 LLM 缩放范式而设计。2024 年 o1 在早期推理加持下也只拿到 18%;2026 年更难的 ARC-AGI-3 发布时,前沿 AI 仅 0.5%。而现在 Astra(使用原生 harness)直接完全饱和了该基准。
所属事件:GPT-6 Astra 刷爆 ARC-AGI-3,操作步数少于人类平均(4 条相关)→
「模型」频道最新
- 按 token 计价已失真:Astra 每任务成本反低于便宜 13 倍的 Flash — stevenheidel · 2026-09-04
- 传 GPT-6 Astra 心算竞赛级数学,隐式推理能力大幅跃升 — nabeelqu · 2026-09-04
- Matt Shumer 实测 GPT-6 Astra:首个敢放手让它用电脑的模型 — mattshumer_ · 2026-09-04
- 研究者质疑 Astra 对齐宣称:指标变好可能只是更会躲检测 — connoraxiotes · 2026-09-04
- Qwen 3.8 27B 对比 3.6:质量升 8%,耗时却长 5 倍 — DerTomsn · 2026-09-04
- 爆料称 GPT-6 Astra 用超 10 万张 GPU 训练,规模创 OpenAI 纪录 — BLUECOW009 · 2026-09-04