ARC-AGI-3 计分方式被指非标准,GPT-6 满分或系高估
peterwildeford · x · 2026-09-14
- ARC 前研究员 Peter Wildeford 感叹 ARC-AGI-3 的计分方式「比我想象的还要离谱」。
- Sterling Croxton 指出:ARC-AGI-3 采用一种完全非标准的分数计算方式,像 GPT-6 一类模型「跃升至约 100%」的高分很可能主要是这种计分方法造成的,而非能力真实飞跃。
- 评论者认为 ARC 方面本不应采用这种算法,如今结果引发争议,「搬起石头砸了自己的脚」。
- 该讨论提示:解读 ARC-AGI-3 上模型的成绩时需谨慎,分数口径可能与以往 benchmark 不可比。
「模型」频道最新
- Astra Python 用法惊艳,博主称 V4.1 Flash 是「proto-AGI」 — teortaxesTex · 2026-09-14
- Ollama 联合创始人:小模型已能胜任大多数对话与推理场景 — ollama · 2026-09-14
- 用户吐槽 GLM Flash 5.3 输出频繁滑回中文 — DevDminGod · 2026-09-14
- AI 攻克纳维-斯托克斯千年难题,OpenAI 两周内训出数学跃迁模型 — TheZvi · 2026-09-14
- Embedding 只用来做检索?作者盘点被浪费的隐藏能力 — ProposalOrganic1043 · 2026-09-14
- 让模型用 Python 代码作画,V4.1 Pro 展现惊人编程审美 — teortaxesTex · 2026-09-14