零模型调用跑通 ARC-AGI-3:非 LLM 推理系统实测
Living_Substance1274 · reddit · 2026-08-10
开发者 Orivael 构建了一个完全不使用 LLM 的实验性推理系统,并在 ARC-AGI-3 测试中取得了亮眼成绩。
- 成绩亮点:在 ft09 任务中取得 100% 准确率(6/6 关卡,80 步动作,优于人类基线的 208 步),且整个过程的模型推理成本为 $0.00。但在其他任务(如 tr87, cd82)中得分较低。
- 失败模式分析:作者发现系统的主要失败原因并非逻辑错误,而是基于对环境的错误表征得出了合理的结论。例如:精灵与墙壁颜色相同导致系统误判被包围,或按钮在特定状态下被误判为无效。
- 核心挑战:系统在识别游戏机制后能变得极其高效,但真正的难题在于:如何在不带入先前世界假设的情况下,识别出当前进入的是一个怎样的新世界?
「研究」频道最新
- CoRL 2026 征稿:探究人类数据驱动机器人学习的 Scaling Laws — mangahomanga · 2026-08-10
- 论文警示:AI砍掉初级岗位将引发“认知公地”悲剧 — rohanpaul_ai · 2026-08-10
- 学者提议期刊直接弃用 AI 生成的同行评审报告 — Afinetheorem · 2026-08-10
- AI 解决搁置 25 年的无线通信理论难题 — Singularitarian · 2026-08-10
- AI 设计病毒能治百病?研究实为攻克超级细菌 — alex_verem · 2026-08-10
- 可解释性研究:先讲故事再设计实验,还是只做实验? — unironictechbro · 2026-08-10