GPT-6 Astra 满分 ARC-AGI-3,但评测口径并不公平
mhmazur · x · 2026-09-04
Steven Heidel(OpenAI)展示 GPT-6 Astra 在 Responses API 开启 compaction 后,ARC-AGI-3 满分,超过 Opus 5 和 GPT-5.6 Sol。
不过 mhmazur 指出该对比不等价:Astra 的分数使用新的 Provider Adapter harness(可在多次请求与压缩间保留不透明推理),而 Opus 5 与 GPT-5.6 Sol 的分数用的是 Standard harness,口径不一致,不能直接横比。
所属事件:OpenAI 推出 Responses API 压缩功能,GPT-6 Astra 满分 ARC-AGI-3(3 条相关)→
「模型」频道最新
- Databricks 评测:GPT-6 Astra 登顶 OfficeQA Pro 数据推理新 SOTA — downingARK · 2026-09-04
- 数学家实测 GPT-6 Astra:边写论证边在 Lean 里实时验证证明 — teortaxesTex · 2026-09-04
- Tavus 发布 Sparrow-2:主打轮次检测与打断处理的对话理解模型 — ycombinator · 2026-09-04
- ARC-AGI-3 实测:max 推理多花 10 倍 token,总成本反降三成 — i_dg23 · 2026-09-04
- 研究者指 OpenAI Astra 系统卡存在数学基准数据污染疑点 — dfrsrchtwts · 2026-09-04
- antirez:评价新模型别看 three.js demo,看它能否解决真实阻塞难题 — antirez · 2026-09-04