671B 参数模型每 token 只激活约 37B:一文讲透 MoE 原理与代价
techNmak · x · 2026-09-12
一篇科普长文解释 Mixture of Experts 为什么让「671B 模型」不必动用 671B 参数生成每个 token:
- 原理:把 Transformer 每层的单个前馈网络换成多个「专家」子网络加一个小路由器,路由器根据当前 token 表示决定交给哪几个专家处理。专家的分工不是人工指定的,而是训练中涌现的。
- 例子:DeepSeek-V3 总参数 671B,但每个 token 只激活约 37B,其余参数在该次计算中「休息」——稀疏 MoE 用这种方式提升参数容量而不等比支付计算成本。
- 常被忽略的代价:未激活不等于不存在。权重仍需存储在加速器上,路由器要把 token 表示跨设备送到对的专家;负载不均、专家利用率平衡、通信开销都是独立的工程难题。
- 结论:671B MoE 不是伪装的 37B 模型,而是「学会了为每个 token 选择唤醒自己哪部分」的 671B 模型——理解这点后,现代模型许多奇怪的参数规模就好懂了。
「模型」频道最新
- SGLang 深度适配 DeepSeek V4.1 Flash,24 小时内冲到 873 tok/s — BanghuaZ · 2026-09-12
- GPT-Live τ-Voice 成绩相差 20 个百分点,后端模型影响巨大 — rdesh26 · 2026-09-12
- GPT-Live 定价 $0.05/分钟折算约 $28/M tokens,或为中型前端模型 — rdesh26 · 2026-09-12
- 开发者逆向工程 Astra 计算机使用能力,声称提速 2 倍 — iamrobotbear · 2026-09-12
- DeepSeek 发布 V4.1-Flash:原生视觉理解,建站成本仅 Claude 的 1/40 — togethercompute · 2026-09-12
- 「病毒式突破」实为三年老技术:abliterated GLM 5.3 解禁内幕 — thursdai_pod · 2026-09-12