GPT-6 Astra 刷新 ARC-AGI 纪录:标准测试 62.7%,新架构下达 99.9%
repligate · x · 2026-09-04
ARC-AGI 团队的 mhmazur 发长文分析 GPT-6「Astra」的测试成绩,称这是其职业生涯的高光时刻:
- 在标准 harness 下(允许模型跨请求携带笔记,AI 公司间公认对齐比较),Astra 得分 62.7%,超过此前验证最高分的一倍以上,并在 ARC-AGI-2 上创下新高。
- 用新的 provider adapter harness(保留模型不透明推理状态、上下文增长时用原生 compaction)测试,ARC-AGI-3 上得分高达 99.9%。
- 团队宣布今后将同时用两种 harness 测参评模型。
发帖人评论称 Astra「把成本/性能曲线反向弯折」,暗示其性价比表现反常地好。
所属事件:GPT-6 Astra 刷爆 ARC-AGI:三代基准成绩全公开(3 条相关)→
「模型」频道最新
- ChatGPT 新功能:可匹配关联应用的写作风格,还送 Yubikey — btibor91 · 2026-09-04
- 传 GPT-6 已发布,特斯拉 Cybercab 开始无方向盘公开载客 — Dr_Singularity · 2026-09-04
- Astra 早期用户集中发搅拌机视频,被质疑协调造势 — jdjohnson · 2026-09-04
- 研究者吐槽评测靠推特风向,预告基于 EvalEval 的动态综合指数 — evijit · 2026-09-04
- OpenAI 工程师称 GPT-6「Astra」写作质量进步巨大 — mark_k · 2026-09-04
- Voz 深度优化 ANE,iPhone/Mac 本地语音转写提速 5-20 倍 — pcuenq · 2026-09-04