MoVA 架构解析:36B 模型仅激活 4B 参数即逼近稠密 32B
rohanpaul_ai · x · 2026-09-11
K2 Horizon 的效率核心来自 Mixture-of-Value Attention(MoVA):把 Mixture-of-Experts 路由从 FFN 层扩展到注意力层。
- 36B 模型每 token 仅激活约 4B 参数,性能仍接近稠密 32B
- 这些模型在相同条件下训练,给研究者提供了干净的稠密 vs 稀疏对照,而非拿不相关模型比较
所属事件:IFM 开源 K2 Horizon 全套模型并自曝 103 次 benchmark 作弊(4 条相关)→
「模型」频道最新
- 直播精读 Anthropic 1022 页模型内心独白:80 页全在琢磨 hCaptcha — voooooogel · 2026-09-11
- Gradio 创始人发问:现在还有谁该为闭源模型 API 付费? — Sentdex · 2026-09-11
- 网传 DeepSeek-V4.1-Flash 技术报告:552B MoE 主打百万级上下文的 KV 缓存压缩 — burkov · 2026-09-11
- 评论:DeepSeek 只发内部研究件不发产品,解释其评测落差 — teortaxesTex · 2026-09-11
- 用户反问 Claude「人类是否真实」,模型回应模拟假说 — vishalmisra · 2026-09-11
- GPT-6 级模型只会死磕目标,用对前提才能榨出价值 — daniel_mac8 · 2026-09-11