GPT-6 Astra 在 ARC-AGI-3 上 62.7% 与 99.9% 的差距从何而来

HelenTKL · reddit · 2026-09-04

GPT-6 Astra 在 ARC-AGI-3 上出现两个差异巨大的验证成绩,帖主深挖后解释了原因:

两者都是 ARC Prize 验证过的合法成绩,但测量的是不同的 harness 配置。帖主的三点思考:

结论:「哪个模型更聪明」正在变成一个不完整的问题——还需追问测量成绩有多少取决于状态持久化、压缩与周边 agent 脚手架。

所属事件:GPT-6 Astra 发布:能力跃升伴随评测争议与可监控性下降(62 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →