四大高效架构横评:DeepSeek 与 MiMo 用 YOCO,Qwen/GLM 走 3:1 交错
eliebakouch · x · 2026-09-24
作者对比了四个最先进的高效架构模型:DeepSeek V4.1 Flash、MiMo V3、Qwen 3.8 Next Flash 和 GLM 5.3 Flash。
要点:
- DeepSeek 和 MiMo 思路相近,都采用 YOCO(You Only Cache Once):只有网络前段在 prefill 时激活以构建 KV cache 表示,不使用线性注意力,并带 token 级 indexer
- Qwen 和 GLM 则采用更标准的 3:1 交错(interleaving)结构
- 作者还期待 Kimi 加入这一梯队,并提到 MiniMax 已有 MSA 架构本可纳入对比
所属事件:四大高效架构横评:DeepSeek、Qwen、GLM、小米注意力对比(2 条相关)→
「模型」频道最新
- 用户实感:Claude 额度机制生变,本周主要被 Opus 限额卡住 — rudrank · 2026-09-24
- 用户质疑 OpenAI 用 Sol 换皮 Terra 降价却砍用量额度 — RexDouglass · 2026-09-24
- 生成 demoscene demo 只用掉 Opus 5.5 周额度的不到 3% — gandamu_ml · 2026-09-24
- 研究者发现 Mythos 激活方向与基因组语言模型惊人相似 — jatin_n0 · 2026-09-24
- 物理场景实测:GLM-5.3 牛顿摆完胜隐身新模型 Space Bunny Alpha — rohanpaul_ai · 2026-09-24
- theo 锐评模型格局:Anthropic 缺小模型,OpenAI 缺大模型 — james_mtc · 2026-09-24