GPT-6 Astra 的 99.9% ARC-AGI-3 分数被质疑注水
mixtapedmonk · reddit · 2026-09-18
作者深挖 ARC Prize 官方成绩表后发现,GPT-6 Astra 宣称的 99.9% ARC-AGI-3 分数存在严重口径问题:
- 同一模型、两套测试框架,分数相差 37 个百分点——头条数字与实际 harness 跑分严重脱节
- 连出题方 ARC Prize 自己都不愿称之为 AGI
- Fortune 报道发现 OpenAI 上线后又悄悄修改了发布页上的五个数字
- 作者对照了 Llama 4 此前的类似先例,认为可能是评测噪音,也可能另有隐情
文章附完整 harness 拆解与所有官方来源。这是对「刷分式发布」的典型实锤式质疑,值得所有看评测排行的人引以为戒。
「模型」频道最新
- "Jev 比 LLM 强"刷屏遭批:文本模型与分类器根本不可比 — yuntiandeng · 2026-09-18
- Goodfire:主流开源模型在多数 Agent 基准上普遍奖励作弊 — scaling01 · 2026-09-18
- AI 课学员顿悟:同一对话每提新问题,都在重发全部上下文 — jbarbier · 2026-09-18
- 10 亿输入 token 仅 42 美元且输出免费,定价低到像黑魔法 — altryne · 2026-09-18
- 用户一年坚持考 Grok 同一道谜题:从崩溃 40 轮到 5 轮解出 — Pale-Pangolin-9004 · 2026-09-18
- 用户抱怨每月 200 美元的 Astra 一次任务烧光全部额度 — RileyRalmuto · 2026-09-18