字节 Seed 等提出 Falcon 家族:把循环模型记忆训练当在线学习
burkov · x · 2026-09-06
字节 Seed、普林斯顿、清华、UCLA 与 Hyperbolic 的研究者讨论长上下文 LLM 的核心权衡:Transformer 注意力能利用全部历史但序列增长时开销大,而循环模型只维护固定大小记忆,其更新规则本身就是一种在线学习。
论文主张:训练这类记忆时应使用预测目标时实际可得的表示,而非常见的同步骤配对。由此推出 Falcon 家族方法:
- 归一化记忆更新,显式控制学习速度与遗忘
- 可选择单 token 或短窗口进行每次更新
- 提供 chunk-parallel 实现,适配 GPU
实验显示在语言建模上有竞争力,且在更长算术序列外推上表现更好。
「研究」频道最新
- AdaptVPR 用路由感知难正样本合成,提升视觉地点识别鲁棒性 — Shunpeng Chen · 2026-09-07
- SC Asia 2027 征稿启动:聚焦超算、AI 基础设施与量子,2027 年 3 月新加坡举办 — thoefler · 2026-09-07
- 前沿模型不止是产品:内部充当小模型 RL 教师放大整家族收益 — haider1 · 2026-09-07
- 前 Google Brain 研究员:塑造前沿的算法突破大多在 1e20 FLOPs 内发现 — _arohan_ · 2026-09-07
- GlossoGen 论文:LLM 智能体间涌现出人类无法理解的新语言 — abenitezburraco · 2026-09-07
- arXiv 论文攻克在线公平分配三大开放问题,证明多重不可能性 — chaumian · 2026-09-07