循环语言模型新法:参数与 KV 缓存省 3 倍仍媲美 Transformer
ChengleiSi · x · 2026-10-03
研究者 huskydogewoof 发布题为「Rethinking at Fixed Points」的研究长线程,主张循环语言模型(looped LMs)无需为每次循环付出全部代价:可用 3 倍更少的参数和 3 倍更小的 KV cache,达到与标准 Transformer 相当的效果,即以恒定内存通过增加 FLOPs 来扩展能力。
核心是利用循环的不动点(fixed point),并提出:
- Fixed-Point Shortcuts:分析不动点在训练(预训练、后训练)和推理(prefill、解码)阶段能为循环模型带来什么
- 学习到的深度先验(learned depth prior)与正交注入(orthogonal injection):两种塑形不动点的方法
作者在原帖附了完整长线程展开细节。
「研究」频道最新
- 基因组级 ORF 筛选发现 NKX2-5,让老年小鼠恢复视力 — anshulkundaje · 2026-10-03
- Hutter Prize 迎 20 年最大进展:一月内三获奖项共提升近 10% — mhutter42 · 2026-10-03
- AI2 发布 4B 模型 MolmoMotion,按语言指令预测 3D 点轨迹 — rsasaki0109 · 2026-10-03
- 宇树开源 UnifoLM-WLA-1.0:6B 单模型驾驭人形机器人 64 项任务 — WebAssemblyMan · 2026-10-03
- 数学家 Kontorovich 认错:AI 自主形式化数学从笑话变成现实 — AlexKontorovich · 2026-10-03
- 新论文:训练LLM主动说出“我在被评测”,口头化评估意识 — xuanalogue · 2026-10-03