ICLR 2026 论文 MoM:混合多记忆状态破解线性模型召回短板
kastnerkyle · x · 2026-09-12
ICLR 2026 Poster 论文提出 Mixture-of-Memories(MoM),针对线性注意力、SSM、线性 RNN 等线性序列建模方法把整条序列压缩进单一固定大小记忆状态、导致 recall 密集任务表现不佳的问题。
- MoM 维护多个独立记忆状态,由路由网络把输入 token 分配到不同记忆状态,提升总记忆容量并减少记忆间干扰
- 可作为通用框架与各种记忆更新机制组合,适用于现有线性模型
- 每个记忆状态计算保持线性复杂度:训练为线性、推理为常数复杂度
- 实验显示 MoM 在下游语言任务尤其是 recall 密集任务上超过现有线性序列模型,接近(Transformer)水平
「研究」频道最新
- 开源说话人分离模型 SUPlime 超越 pyannote 商业版,基准 DER 15.86 — solyarisoftware · 2026-09-12
- 1.9万人实验:AI说服力胜过世界冠军辩手,筹资效果达人类3倍 — ben_j_todd · 2026-09-12
- 把 token 局部交互计算从推理挪进训练,被视为规模化优化新蓝图 — AccBalanced · 2026-09-12
- 开源方案实现零训练-推理失配的大 MoE 模型 RL 训练 — kastnerkyle · 2026-09-12
- 哈佛研究员用果蝇大脑连接组交易比特币,1.5 天跑赢 ML 模型 — Scobleizer · 2026-09-12
- 8 个 LLM 与 1.8 万人对比:模型会做难题却常缺失基础知识结构 — rohanpaul_ai · 2026-09-12