Reddit热议:ARC-AGI 3测试机制被指严重失真
Glittering-Neck-2505 · reddit · 2026-07-30
一位开发者发文质疑 ARC-AGI 3 基准测试的公平性,认为其当前机制无法真实衡量通用人工智能(AGI)的能力。
- 记忆重置缺陷:测试原本故意阻止推理智能体(Reasoning Agent)跨操作维护上下文,迫使模型不断“遗忘”已推理出的步骤,这严重背离了真实前沿智能体的工作方式。
- 上下文压缩的威力:当 OpenAI 允许智能体保留推理过程并压缩旧上下文(Context Compaction,类似人类做笔记)后,其测试分数飙升了近三倍,且消耗的 Token 数量大幅减少了 6 倍。
- 结论:作者指出,强制擦除记忆来测试智能体是不合理的。如果现实中的智能体能像人类一样利用记忆和上下文学习来完成任务,那这就应该算作 AGI。当前的 ARC-AGI 3 为了增加难度而牺牲了测试的初衷。
「漫话AGI」频道最新
- 奥特曼担忧少数人以安全为由垄断 AI,Anthropic 陷毁书争议 — vista8 · 2026-07-30
- 深度探讨:若 AI 拥有意识,对齐问题与伦理责任将如何重塑? — RileyRalmuto · 2026-07-30
- 观点:AI 生成内容正在全面淹没 UGC 生态 — gaganghotra_ · 2026-07-30
- OpenAI 非营利时代产出至今无人超越,引发行业反思 — suchenzang · 2026-07-30
- 预测:两年半后 AI 模型将实现 5 倍提速与成本减半 — OfirPress · 2026-07-30
- AI 剥夺精英优势:算力所有权将成核心社会问题 — zetalyrae · 2026-07-30