Ling-3.0-flash 部署解析:总参数与激活参数的真相

Sitkin_Marrel · reddit · 2026-09-02

文章以 Ling-3.0-flash 模型(124B 总参数,5.1B 激活参数)为例,澄清了 MoE 架构中常见的误解。激活参数仅代表每 Token 计算时参与的路由网络规模,并不等于模型在内存中需存储的权重大小。在 DGX-Spark 上的部署实践显示,INT4 量化后的权重仍需约 72GB 显存。文章指出,评估 MoE 模型应综合考虑激活计算量、安装权重大小、上下文长度及并发对硬件的实际消耗,而非仅看激活参数。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →