MoVA 新架构:稀疏值专家提升注意力容量且不增 KV 缓存
rupspace · x · 2026-09-22
IFM 介绍其新注意力架构 MoVA(Mixture-of-Value Attention)的设计思路:
- GQA 的取舍:分组查询注意力通过在注意力头之间共享 key/value 降低 KV 缓存,但更多分组意味着更大缓存。
- MoVA 的做法:不在分组维度上扩容,而是在现有分组内引入稀疏值专家——在 value 计算中加入额外参数和非线性,value 向量维度不变;每个 token 只从 64 个值专家中选 4 个(激活率 6.25%)。
- 核心优势:在标准 GQA 基础上为 value 矩阵增加建模容量,且不产生额外 KV 缓存开销,兼容 flash attention、GQA、稀疏注意力等高效注意力算法。
「模型」频道最新
- 小米 MiMo-V2.6 或是开源界最大规模单次 RL 训练,登顶开源模型 — timshi_ai · 2026-09-22
- 特斯拉 FSD 老将吐槽:LLM 从业者的工作变成了追柱状图 — yunta_tsai · 2026-09-22
- Grok 九周连发三版:4.5 到 4.7 迭代节奏惊人 — XFreeze · 2026-09-22
- 曝 OpenAI 赶造 Codex Bot 对标 Grok Bot,并发文谈递归自我改进 — dotey · 2026-09-22
- AI 解出千禧年数学难题后,该高调宣布还是低调行事? — ChowdhuryNeil · 2026-09-22
- 工程师用 Agent 集群 20 小时自主训出对标 Jev 的模型,总花费仅 3100 美元 — denisyarats · 2026-09-22