GPT-6 Astra 成绩悬殊:ARC Prize 指脚手架是关键
ARC Prize 用自家标准 harness 与 OpenAI 的 Provider Adapter 分别测试 GPT-6 Astra,发现同一模型在 ARC-AGI-3 上成绩差异巨大:标准 harness 最高推理档仅约 62%-63%,而 OpenAI 报告的 99.9%(或 97%)依赖特定脚手架。作者据此论证,在选型 agent 时,模型之外的 harness 代码可能比模型本身更重要,并总结了 7 条工程规则。
2026-09-07 ~ 2026-09-08 · 2 条相关
- ARC-AGI-3 结果:同一模型换 harness 后从 63% 飙至 97%,7 条工程规则 — victor_explore · 2026-09-07
- 同一模型两套成绩:ARC Prize 称 GPT-6 Astra 的 99.9% 靠脚手架 — GaryMarcus · 2026-09-08