前 OpenAI 员工抨击 ARC-AGI:模型表现并非 1%,系内存受限
inductionheads · x · 2026-08-28
前 OpenAI 员工 @FakePsyho 指出 ARC-AGI 正在推行“完全错误的叙述”,官方称所有 AI 模型得分低于 1% 具有误导性。
- 观点核心:模型心智上完全有能力解决这些问题,瓶颈在于内存(上下文长度),而非推理能力。
- 证据支撑:ARC Prize 发布后 24 小时内,Agentical 发布的自定义 Harness 框架在 GPT-5.4 上取得了 40% 的分数。@FakePsyho 审查后认为该方案具有通用性,并非硬编码。
- 结论:ARC-AGI 的数据其实显示了模型的潜力,目前的低分是由于测试框架的局限性(如缺乏内存补丁)造成的。
「模型」频道最新
- ChatGPT 绘制人类动作示意图翻车:肢体错位离谱 — kaljakin · 2026-08-28
- 传 OpenAI 密集预训练中,远期大模型代号「Bel」浮出水面 — haider1 · 2026-08-28
- Yutori n2 登陆 Crusoe 云端,低成本实现计算机控制 — DhruvBatra_ · 2026-08-28
- Epoch 让 GPT-5.6 Sol 玩《杀戮尖塔》:卡在战术而非操作 — Jsevillamol · 2026-08-28
- GPT-5.6 Sol 一下午逆向重构 32 位 iOS 游戏 — gpt2chatbot · 2026-08-28
- 通义 Qwen Flash 性能超越 DeepSeek 与 GLM 5.3 — bindureddy · 2026-08-28