Maglev:引入滑动循环记忆,实现并行训练与高效序列解码
ChengleiSi · x · 2026-08-12
Maglev 是一种结合了固定大小记忆的循环 Transformer 架构,旨在实现训练时的并行化与推理时的序列化解码。
- 架构设计:包含一个利用全注意力的预填充器 $Q$ 和一个仅使用滑动窗口注意力的解码器 $P$。$Q$ 负责生成记忆目标,$P$ 则通过循环 K/V 注入产生用于下一个 token 预测的记忆。
- 训练与推理:训练期间使用记忆一致性损失来对齐两者的记忆状态;推理时则完全抛弃 $Q$,仅依靠 $P$ 进行前向循环,从而消除训练与推理的差距。
- 实验效果:相比滑动窗口和潜在循环基线,该架构显著改善了验证损失和下游基准表现。此外,在 $P$ 和 $Q$ 之间共享参数还能在保持大部分性能提升的同时减少参数内存占用。
「研究」频道最新
- 1B参数西语网络安全视觉模型VectraYX-Vision开源 — Juan S. Santillana · 2026-08-12
- 新方法GHD用未来屏幕信息优化移动端GUI智能体 — Weiwei Li · 2026-08-12
- MIT研究员推出AI训练动态可视化复现工具 — ZimingLiu11 · 2026-08-12
- AI 破译五千年楔形文字,阿卡德语泥板可直接译为英文 — coinfanking · 2026-08-12
- 树莓派跑通机器人路径规划算法,19秒覆盖全校 — 4310sy · 2026-08-12
- NBER论文:生成式AI或走向寡头垄断,开放生态需靠巨头破局 — soumitrashukla9 · 2026-08-12