Chollet 回应争议:ARC-AGI-3 校准良好,人类认真做可达 90%+
fchollet · x · 2026-09-04
ARC 作者 François Chollet 回应 ARC-AGI-3 发布以来遭受的质疑。3 月发布时前沿模型得分不足 1%,部分 Singularitarian 观点者认为基准本身有问题:无法被最聪明的人类解决、可达分数上限只有 40% 等,团队因此承受了大量攻击。
Chollet 现在 表示:
- 基准校准完全正常:只要比普通受试者做得更好(用更少的操作数),认真投入的聪明人类就能拿到 90% 以上甚至 100%;人类基线本身不强,因为用的是未筛选的受试者。
- 相应地,一旦智能体通用智能取得真实进展,AI 拿到 100% 也是完全可行的。
这篇回应等于把「基准坏了」的指控反驳为「模型还不够强」。
「模型」频道最新
- Astra 从低算力到满配解决率几乎不变,RL 扩展故事遭数据打脸 — zainhas · 2026-09-05
- Sam Altman:下一代模型会让所有人清醒, capability 远超现有水平 — ChrisGPT · 2026-09-05
- 实测发现 Astra 高努力档空耗 token,terminal bench 上仅低中高档可用 — zainhas · 2026-09-05
- GPT 6 Astra 支持对话中途调整推理强度且缓存不失效 — intellectronica · 2026-09-05
- 「别用过去式称呼模型」:网友惋惜 Opus 3 时代落幕 — repligate · 2026-09-05
- Astra 以 30k tokens 跑出 74% DeepSWE 成绩,效率碾压 GPT-5.6 Sol — haider1 · 2026-09-05