Tilde 发起 One Layer Deeper 竞赛测试更深串行计算
marksaroufim · x · 2026-08-04
Tilde 发起 One Layer Deeper:研究模型如何学会“更深的串行计算”
这篇文章认为,当前推理模型主要靠生成更多 token 来“想更久”,但这会把一些本可以在潜空间里并行完成的中间计算,强行变成文本序列里的逐步输出。
作者提出,另一条路是让模型在问题更难时,改为通过更深的 latent depth 来扩展计算能力;问题在于,这类模型过去往往更难训练。
文章核心观点
- 难点未必是“没有更好的串行计算架构”。
- 更可能是当前优化方法天然偏向标准 Transformer。
- 真正需要的是架构、目标函数、优化器的联合设计。
竞赛信息
- 公共任务:重复模平方(repeated modular squaring),用来测试“学到的深度”。
- 目标:学习更深的串行计算,并在训练深度之外继续泛化。
- 截止时间:2026 年 8 月 31 日。
- 关注点:架构–优化器–目标函数协同设计。
所属事件:Tilde 发起 One Layer Deeper 竞赛探索模型深度计算(3 条相关)→
「研究」频道最新
- LightParkour 将少量人类动作种子蒸馏成可部署人形跑酷策略 — CyberRobooo · 2026-08-04
- RL 研究者争论:Dyna 式系统该叫 model 还是 world model — tw_killian · 2026-08-04
- METR 用 NanoGPT 测出 AI 优化能力的“支出视界” — gleech · 2026-08-04
- Goodfire AI 正在拆解 LLM,研究它们如何思考 — Scobleizer · 2026-08-04
- Lightbot 0 学会跑酷式全身接触动作,面向救援场景 — CyberRobooo · 2026-08-04
- Lean 形式化 Mochizuki abc 证明,又卡在同一关键步骤 — MarioKrenn6240 · 2026-08-04