Maglev 架构:用滑动循环记忆解决 Transformer 遗忘难题
anselm · x · 2026-08-19
Maglev 提出一种新的 Transformer 架构,旨在解决全量注意力计算昂贵、滑动窗口容易遗忘的问题。
核心机制:
- 双模型耦合:包含一个使用全量注意力的预填充器和一个使用滑动窗口的解码器。
- 记忆对齐:预填充器生成记忆目标,解码器通过 KV 注入学习重现并携带这些记忆。
- 高效推理:训练后可移除预填充器,仅用解码器实现固定大小的非线性持久记忆。
结果: 在验证损失和预训练基准上优于滑动窗口和潜在循环 Transformer 基线。
「研究」频道最新
- Awesome AI4AI 发布:AI 改进 AI 领域的动态全景图 — No-Strawberry-2588 · 2026-08-19
- 智谱 GLM-5.3 突破源于后训练而非基座 — teortaxesTex · 2026-08-19
- 化学家力挺 Claude 蛋白结合剂设计:你没跑过计算化学软件 — chaitjo · 2026-08-19
- 人形机器人今年集体撞栏跑偏:自主视觉追不上飞奔的腿 — 2C_ornot2C · 2026-08-19
- Naur「编程即理论建构」:为何 LLM 无法让你的代码更简单 — math_rachel · 2026-08-19
- 智谱 GLM-5.3 官方长文:参数量之外,Scaling Law 还有别的旋钮 — pmttyji · 2026-08-19