GPT-6 Astra 满分 ARC-AGI-3,但评测口径并不公平

mhmazur · x · 2026-09-04

Steven Heidel(OpenAI)展示 GPT-6 Astra 在 Responses API 开启 compaction 后,ARC-AGI-3 满分,超过 Opus 5 和 GPT-5.6 Sol。

不过 mhmazur 指出该对比不等价:Astra 的分数使用新的 Provider Adapter harness(可在多次请求与压缩间保留不透明推理),而 Opus 5 与 GPT-5.6 Sol 的分数用的是 Standard harness,口径不一致,不能直接横比。

所属事件:OpenAI 推出 Responses API 压缩功能,GPT-6 Astra 满分 ARC-AGI-3(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →