四大高效架构横评:DeepSeek、Qwen、GLM、小米新模型注意力设计对比
eliebakouch · x · 2026-09-24
一条技术长推对比了 4 个最先进的高效架构:DeepSeek V4.1 Flash、MiMo V3、Qwen 3.8 Next Flash、GLM 5.3 Flash(可视化由 Opus 5.5 与作者共同完成)。
两大流派:
- DeepSeek 与 MiMo 相似:采用 YOCO,仅网络前段在 prefill 阶段活跃以构建 KV 缓存表示,无线性注意力,配 token 级 indexer;
- Qwen 与 GLM:采用更标准的 3:1 交错(与 Kimi K3 相同)的稀疏注意力 + 线性注意力(GDN vs KDA)。
其他共性:DeepSeek 和 Qwen 都用 Engram;除 GLM 5.3 Flash 外都使用 gate 或 sink;全/稀疏注意力层均不用或部分使用 RoPE;均配备精细的残差网络(简化版或完整版 mHC,或门控残差);训练都用 Muon 优化器。
所属事件:四大高效架构横评:DeepSeek、Qwen、GLM、小米注意力对比(2 条相关)→
「研究」频道最新
- Anthropic 生物学团队:一年内 Claude 能力进步惊人,已打通假设到实验验证 — Flomerboy · 2026-09-24
- IROS 2026 全会辩论:机器人该走通用路线还是专精路线? — siddhss5 · 2026-09-24
- 格点高斯分布最大化香农熵,构成与黎曼θ函数相关的指数族 — FrnkNlsn · 2026-09-24
- 研究者称计算深度是缺失的 scaling 轴,网络深度自 GPT-3 起停滞百层 — burny_tech · 2026-09-24
- 跑基准测出「arjunomics 在权重里」,持续基准暴露对齐隐患 — kenbwork · 2026-09-24
- Arena 开放 2026 秋季学术计划,单项目最高资助 5 万美元 — arena · 2026-09-24