Raven 模型新架构:稀疏记忆路由实现长上下文高召回率
bronzeagepapi · x · 2026-08-01
由 Albert Gu 等人提交的论文《Raven: High-Recall Sequence Modeling with Sparse Memory Routing》提出了一种新的线性时间序列模型 Raven。
该模型旨在解决现有模型在长上下文召回中的权衡问题:状态空间模型(SSM)密集更新状态易导致干扰,而滑动窗口注意力(SWA)则因固定窗口导致旧信息被直接丢弃。Raven 维护了一组固定的记忆槽,并通过学习到的、依赖输入的路由机制,在每一步仅衰减和更新选定的子集。
这种稀疏记忆路由机制有效结合了两者优势。实验表明,在召回密集型基准测试中,Raven 表现优异,且在 extrapolating 到训练长度 16 倍的上下文时依然保持有效。
「研究」频道最新
- 研究证实:AI辅导能提升沟通共情力且不抹杀个人表达 — mattgroh · 2026-08-01
- 研究展示:AI 在共情沟通与增强人类潜能方面的应用 — mattgroh · 2026-08-01
- 卡内基梅隆大学提出 GymAnything:自动构建万级任务环境 — pratyushmaini · 2026-08-01
- 拉普拉斯变换硬核科普:揭秘 Mamba 架构背后的数学原理 — JosephJacks_ · 2026-08-01
- Hugging Face 开源 Pangram 模型与数据集,基于 ICLR 论文 — AaronBergman18 · 2026-08-01
- Emulated:用「整家公司」级仿真环境训练全自主软件工程师 — AI Engineer · 2026-08-01