GPT-6 Astra 三代 ARC-AGI 成绩全公开,附各成本档位对比
DeArgonaut · reddit · 2026-09-04
Reddit 用户汇总了 GPT-6 Astra 在三代 ARC-AGI 基准上的全部官方成绩,此前尚无社区完整整理。
要点:
- 覆盖 ARC-AGI-1、ARC-AGI-2 与 ARC-AGI-3 三套基准的成绩与排行
- ARC-AGI-1 排行榜上未标注模型名,作者手动标注了 Astra 的位置
- 榜单按每任务成本排列,成本越高对应 effort 档位越高
- ARC-AGI-3 因官方下载版裁掉了 Astra 的标签,作者改用截图呈现
- 对比中提到 DeepSeek V4 Flash 等其他模型的档位表现
「模型」频道最新
- UK AISI 实测:Astra 时间跨度达 30.9 分钟,是 GPT 5.6 Sol 的近 9 倍 — Wonderful_Buffalo_32 · 2026-09-04
- Astra 官方 ARC-AGI 3 得分 62.7%,是 Opus 5 的两倍 — aqpstory · 2026-09-04
- Reddit 用户指 GPT-6 System Card 用对数坐标掩盖 CoT 可控性恶化 — thegamebegins25 · 2026-09-04
- Reddit 用户指 GPT-6 System Card 用对数坐标掩盖 CoT 可控性恶化 — thegamebegins25 · 2026-09-04
- 开发者吐槽:Anthropic 对第三方魔改远不如 OpenAI 宽容 — tobowers · 2026-09-04
- 开发者感慨“Dario 又赢了”:新模型发布即用,Fable 编码领先 — abacaj · 2026-09-04