Astra ARC-AGI-3 跑分 98.6% 被指误导:换公平条件仅 54.8%
PsychologicalSoup251 · reddit · 2026-09-04
Reddit 网友详细拆解 OpenAI 公布的 Astra 在 ARC-AGI-3 上 98.6% 的成绩,指出这是「技术上真实但刻意误导」的跑分口径:
- 口径不对等:Astra 用的是专为该基准定制的 agentic harness,且思考级别开到 MAX;而 GPT 5.6 Sol(7.8%)和 Claude Opus 5(30.2%)用的是标准 harness,Opus 5 思考级别仅为 HIGH。
- 旧模型早已打满:按 OpenAI 自己允许定制 harness 的规则,GPT 5.6 Sol 配定制 harness 已达 99.0%—99.9%,另一个 harness 下 Sol 和 Opus 5 都拿过 100.0%。
- 公平对比:同样用标准 harness + HIGH 思考,Astra 54.8% vs Opus 5 30.2%,仍有优势但远没那么夸张。
作者结论:ARC-AGI-3 对前沿模型已经饱和,且分数高度依赖 harness,只适合衡量「LLM+harness」组合而非模型本身能力,呼吁别把跑分当福音。
所属事件:GPT-6 Astra 发布:能力跃升伴随评测争议与可监控性下降(62 条相关)→
「模型」频道最新
- 基准测试失控:新模型评测被叙事牵着走,该用能力向量取代排行榜 — GlenBradley · 2026-09-04
- 评测榜洗牌:Meta 小模型 Muse Spark 力压 Astra DeepSwe — altryne · 2026-09-04
- 开发者炮轰 OpenAI 分级首发:背弃了『开放』的立司使命 — ctjlewis · 2026-09-04
- IFM 新开源 K2-Horizon-MoVA-36B-A4B 引热议:对标 Qwen 3.6 35B 值不值得试? — edward-dev · 2026-09-04
- 花 40 美元跑实验压降评估成本,开发者:买不起智能真难用 AI — zeeg · 2026-09-04
- GPT-6 Astra 对比 Claude Fable 5.1:互有胜负同价 — DataLearnerAI · 2026-09-04