Vector Institute 提出 MoME:上下文感知记忆嵌入,用混合槽位消除词义坍缩

vector-institute · hf · 2026-09-21

Vector Institute 提出 MoME(Mixture of Memory Embeddings),一种上下文感知的稀疏记忆机制。现有记忆嵌入方法按词面形式做确定性检索,会把同一 token 的不同语境义(如 python 编程语言 vs 动物)坍缩到同一条固定记忆条目。MoME 将每个 token 的单一记忆行替换为 M 个槽位的混合,用隐藏状态上的可学习门控决定每个位置读取哪些槽。

在 nanochat、Llama-3/MobileLLM、Qwen3 等骨干上的受控预训练实验中,MoME 在等参数与等训练 FLOP 设定下均优于 Value Embedding、Bigram、STEM 基线,在十亿参数以下规模展现出更好的记忆容量扩展趋势,且训练与推理保持高效。路由定性分析显示,学习到的混合路由对不同义项的同一词面 token 会分配到不同记忆槽,具备一定语义可解释性。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →