GPT-6 Astra 在 ARC-AGI-3 上 62.7% 与 99.9% 的差距从何而来
HelenTKL · reddit · 2026-09-04
GPT-6 Astra 在 ARC-AGI-3 上出现两个差异巨大的验证成绩,帖主深挖后解释了原因:
- Standard harness:62.71%(max reasoning)——模型只能保留自己选择携带的笔记
- Provider Adapter:99.95%(high reasoning)——在请求间保留不透明的推理状态,并在长对话中使用压缩(compaction)
两者都是 ARC Prize 验证过的合法成绩,但测量的是不同的 harness 配置。帖主的三点思考:
- 99.95% 的成绩不能与其他模型的 Standard harness 分数直接对比,不是 apples-to-apples
- 但简单斥之为「harness 作弊」也错过重点:如果真实 agent 工作流是有状态的,「模型+harness 组合」可能才是生产环境中真正重要的能力
- 对比也非完全隔离:最好的 Standard 成绩用 max reasoning,最好的 Provider Adapter 成绩用 high reasoning
结论:「哪个模型更聪明」正在变成一个不完整的问题——还需追问测量成绩有多少取决于状态持久化、压缩与周边 agent 脚手架。
所属事件:GPT-6 Astra 发布:能力跃升伴随评测争议与可监控性下降(62 条相关)→
「编程与Agent」频道最新
- Clanker Cloud 开放免费试用:注册即赠 20 美元额度 — tekbog · 2026-09-04
- Clanker Cloud 亮相:自建 Agent 一条龙,企业销售踩坑实录 — tekbog · 2026-09-04
- 像运营公司一样管 AI:Grok Bot 团队配项目经理分工协作 — FinanceYF5 · 2026-09-04
- AI 找漏洞比修漏洞快,工程师如何应对 CVE 积压 — _jaydeepkarale · 2026-09-04
- AAV 提出在意图与执行间加独立授权层治理 AI Agent — CarlosMarreroAAV · 2026-09-04
- 花 40 美元跑实验压降评估成本,开发者:买不起智能真难用 AI — zeeg · 2026-09-04