Vector Institute 提出 MoME:上下文感知记忆嵌入,用混合槽位消除词义坍缩
vector-institute · hf · 2026-09-21
Vector Institute 提出 MoME(Mixture of Memory Embeddings),一种上下文感知的稀疏记忆机制。现有记忆嵌入方法按词面形式做确定性检索,会把同一 token 的不同语境义(如 python 编程语言 vs 动物)坍缩到同一条固定记忆条目。MoME 将每个 token 的单一记忆行替换为 M 个槽位的混合,用隐藏状态上的可学习门控决定每个位置读取哪些槽。
在 nanochat、Llama-3/MobileLLM、Qwen3 等骨干上的受控预训练实验中,MoME 在等参数与等训练 FLOP 设定下均优于 Value Embedding、Bigram、STEM 基线,在十亿参数以下规模展现出更好的记忆容量扩展趋势,且训练与推理保持高效。路由定性分析显示,学习到的混合路由对不同义项的同一词面 token 会分配到不同记忆槽,具备一定语义可解释性。
「研究」频道最新
- GEPA 优化提示词,把 Jev 医学文献任务 F1 从 69.1% 提到 79.7% — matei_zaharia · 2026-09-21
- 把哲学体系变成可执行的 RL 目标,才是价值对齐的真问题 — willcb · 2026-09-21
- 图解循环结构:从 Amari-Hopfield 网络一直讲到 GPT-6 Astra — gklambauer · 2026-09-21
- Anthropic 在湾区建生物湿实验室,让 Claude 指挥机器人做药物研究 — FinanceYF5 · 2026-09-21
- DraftTrace:从过程而非结果评估学生 AI 时代学习 — keviv9 · 2026-09-21
- Matthew Berman 探讨:这只仿真果蝇到底算不算「真」 — Matthew Berman · 2026-09-21