字节 Seed 等提出 Falcon 家族:把循环模型记忆训练当在线学习

burkov · x · 2026-09-06

字节 Seed、普林斯顿、清华、UCLA 与 Hyperbolic 的研究者讨论长上下文 LLM 的核心权衡:Transformer 注意力能利用全部历史但序列增长时开销大,而循环模型只维护固定大小记忆,其更新规则本身就是一种在线学习。

论文主张:训练这类记忆时应使用预测目标时实际可得的表示,而非常见的同步骤配对。由此推出 Falcon 家族方法:

实验显示在语言建模上有竞争力,且在更长算术序列外推上表现更好。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →