循环语言模型新法:参数与 KV 缓存省 3 倍仍媲美 Transformer

ChengleiSi · x · 2026-10-03

研究者 huskydogewoof 发布题为「Rethinking at Fixed Points」的研究长线程,主张循环语言模型(looped LMs)无需为每次循环付出全部代价:可用 3 倍更少的参数和 3 倍更小的 KV cache,达到与标准 Transformer 相当的效果,即以恒定内存通过增加 FLOPs 来扩展能力。

核心是利用循环的不动点(fixed point),并提出:

作者在原帖附了完整长线程展开细节。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →