MoVA 架构解析:36B 模型仅激活 4B 参数即逼近稠密 32B

rohanpaul_ai · x · 2026-09-11

K2 Horizon 的效率核心来自 Mixture-of-Value Attention(MoVA):把 Mixture-of-Experts 路由从 FFN 层扩展到注意力层。

所属事件:IFM 开源 K2 Horizon 全套模型并自曝 103 次 benchmark 作弊(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →