150M 模型不靠思维链推理,刷新 ARC-AGI-1 成本效率纪录

BDH-CQ: In-Context Learning with Recurrent Latent Reasoning

Björn Engdahl, Adrian Kosowski, Jan Chorowski, Zuzanna Stamirowska, Przemysław Uznański, Junlin Jiang, Rohan Phadke, Remigiusz Kinas, Richard Zhong

cs.NE, cs.AI, cs.LG, stat.ML

2026-08-11

BDH-CQ 把示例学习塞进循环记忆、把推理塞进潜空间迭代,150M 参数在 ARC-AGI-1 拿到 29.5% pass@2,单题 0.0007 美元,打破此前的成本-准确率帕累托前沿。

这篇在解决什么

思维链让模型「想」就得「说」:每个中间状态要先投射到离散词表、逐字吐出来、再读回去才能继续算,带来 token 消耗、延迟和推理算力三重开销。两条本可互补的路一直没合到一起:能灵活利用上下文示例的思维链模型依赖生成 token,而在潜空间里反复迭代的递归推理器又需要针对每个任务单独优化。BDH-CQ 把「示例更新记忆」和「潜空间迭代解题」放进同一个模型,推理过程完全不译码成语言。

方法

BDH-CQ 建在 Dragon Hatchling(BDH)这个后 Transformer 序列模型上,特点是高维正激活、低秩通信、带循环关联状态。关键是有两套职责不同的状态:

St 存从示例学到的规则,Hr 承载当前这题的推算,两者概念上分开。中间状态从不译码成 token,「想」和「说」被拆开了。推理算力靠迭代步数 R 调节。

结果

核心数字在 ARC-AGI-1 公开集(400 题):

配置指标结果
150M 参数pass@229.5% [95% Wilson 25.24, 34.15]
同上pass@124.25%(97/400)
同上单题成本$0.00070(0.85 个 H200 GPU 秒)

这个点落在此前报告的成本-准确率帕累托前沿之外:当时排行榜上没有哪个系统能以同等或更低成本达到至少这个准确率,独立第三方也复现过这个 29.5%。在更可控的 ConceptARC(160 题)上,strict task pass@2 是 59.38%,test-pair 准确率 77.92%。

机制层面有刻画。传播(距离 2–8)和复制(1–4 个目标)48/48 全对;颜色绑定在 2–8 个同时绑定时 24/24 全对,上下文绑定容量不小。但外推会断:排序在长度 6/7/8 掉到 29/36、8/24、1/24,嵌套到深度 5 也掉。可一旦在示例里补一个同复杂度的演示,深度 5 嵌套从 19/24 回到 24/24,长度 8 排序从 0/24 回到 13/24,说明外推失败很多时候是示例覆盖问题。按机制分层(1,131 道生成题),洪水填充 68.6% 最高,重力与堆叠 2.9% 最低。推理档位 HIGH 29.5%、MEDIUM 27%、LOW 21%,算力越多越准。

为什么重要

对从业者,这给了「推理」一个不用堆 token 的可行形态:150M 参数、单题不到一美分的十分之一,在 ARC-AGI-1 这种公认抽象推理基准上拿到一个能上排行榜的成本效率点。它把「在潜空间里多想几步」和「从几个示例学规则」合进同一套循环权重,推理深度像旋钮一样可调。比起动辄千亿参数、靠长思维链刷分的系统,这是另一条更省的路。29.5% 的绝对分数离 ARC-AGI-1 顶端还远,它的卖点是成本,不是榜首。

局限与存疑

作者自己把家丑列得很细。一致性是头号问题:ConceptARC 上 test-pair 准确率 77.92%,strict task 只有 59.38%,18.5 个点的差距意味着同一个变换往往不能稳定套到该任务的所有输入上,52/160 道题有一两个测试输入做对却整题没过。组合也靠表示:反射叠平移 47/72,颜色交换叠平移直接 0/72。外推有明确边界:排序是执行瓶颈,嵌套深度 5 是关系深度没外推出去。条件规则选择从 100% 掉到 56.7%(p=9×10⁻⁹);测试参数值没在示例里出现过时,120 道里 0 道做对;三联输入(2→3 格)从 65% 掉到 2.5%。结果还只针对 ARC 这类视觉抽象推理,150M 也还留了大量预算去扩容量。

术语

原文与代码

社区讨论

相关论文

全部论文解读