循环 Transformer 学到的算法,先受训练预算而不是容量决定
jm_alexia · x · 2026-07-25
- 配图里的论文题目是 《When Does Recurrence Become an Algorithm? Convergence Selection in Weight-Tied Looped Transformers》,研究的是 looped transformer 在并行与串行计算之间如何做选择。
- 作者通过受控实验给出了四个核心结论:
- 预算定律:训练会塑造一条线性“计算前沿”,其速度与训练契约匹配;多加 test-time loops 能改善后部位置覆盖。
- 架构先验比表达能力更关键:标准深度 transformer 更容易学到并行 scan,而 weight tying 会把选择推向串行前沿,即使加了位置编码也会这样。
- 瓶颈不是复杂度类别本身:问题不在于任务“能不能算”,而在于算子规模和优化路径是否让模型学得出来。
- 机制是可迁移的:通过 warm-start 可以把学到的算法迁移到新的训练契约上,但单靠输入调度不能“强行灌入”这种机制。
- 论文还提出了一个用于 convergence-time scaling 的 head 指标,并用 activation patching 做了因果验证。
- 配图展示了标题页和核心示意图,包括“budget law”和“mechanisms can be moved, not mandated”的结论。
「研究」频道最新
- 商业化 AI 基准分差很小,可能只是噪声 — PerformanceRound7913 · 2026-07-25
- 发布博客预告:FrontierCode 智能体编码基准打平 — hardmaru · 2026-07-25
- 蒸馏后的小模型可能因更强泛化反超老师 — peterjliu · 2026-07-25
- Opus 5 在九项生物基准登顶,但仍有几项分析任务落后 — kenbwork · 2026-07-25
- ARC-AGI 新解读:符号 AI 正在回潮 — typewriters · 2026-07-25
- 媒体机构生成式AI使用研究招募记者访谈 — QVeraLiao · 2026-07-25