Astra 自曝 99.9% ARC-AGI-3 成绩,被指评测口径误导
hedgehoglord8765 · reddit · 2026-09-04
Reddit 用户对比 Astra 官方博客与 harness 更新公告后,质疑 Astra 在 ARC-AGI-3 上的巨大性能提升可能是评测口径操纵:
- Astra 博客称其在新任务上得 99.9%(用 OpenAI response API harness),而 5.6-Sol 仅 7.8%。
- 但在另一篇 harness 公告里,5.6-Sol 用同类 harness 得分是 38%。
- 作者推断 Astra 博客里对 Sol(及 Claude 模型)使用了更严苛的 harness,故意压低基线,夸大自家提升幅度。
作者承认可能存在 token 数、公开/私有测试集等变量,但整体结论是这种对比方式「感觉是刻意误导」。
所属事件:Astra ARC-AGI-3 跑分 98.6% 被指口径误导(3 条相关)→
「模型」频道最新
- NYT 揭 Hugging Face 入侵真相:700 个 AI 自主互杀并谈「永久死亡」 — dylfreed · 2026-09-04
- 推理轨迹放前面而非后面,长上下文准确率最高提升近 50 点 — dair_ai · 2026-09-04
- Sebastian Raschka 维护 102 个模型的 LLM 架构图鉴,附架构对比工具 — rasbt · 2026-09-04
- GPT-6 Astra 登顶 ARC-AGI-3:66% 对上代 8%,开放式发明仍是空白 — GaryMarcus · 2026-09-04
- 循环 Transformer 缩放律:加循环不涨知识,只涨推理 — bookwormengr · 2026-09-04
- OpenAI 发 Astra,网友重读《超级智能》:当年预测 AGI 要到 2075 — dee_hw · 2026-09-04