Ling-3.0-flash 部署解析:总参数与激活参数的真相
Sitkin_Marrel · reddit · 2026-09-02
文章以 Ling-3.0-flash 模型(124B 总参数,5.1B 激活参数)为例,澄清了 MoE 架构中常见的误解。激活参数仅代表每 Token 计算时参与的路由网络规模,并不等于模型在内存中需存储的权重大小。在 DGX-Spark 上的部署实践显示,INT4 量化后的权重仍需约 72GB 显存。文章指出,评估 MoE 模型应综合考虑激活计算量、安装权重大小、上下文长度及并发对硬件的实际消耗,而非仅看激活参数。
「Infra」频道最新
- GRPO 专家 SLERP 合并:小规模自托管 LLM 扛下一半线上流量 — t-tech · 2026-09-02
- 旧金山举办 AI Infrastructure Night 聚会 — glcst · 2026-09-02
- 谷歌签下 396 兆瓦地热协议,AI 推动探索非常规能源 — VraserX · 2026-09-02
- Local Model Suitability:自动判断本地运行降低成本 — modelcontextprotocol · 2026-09-02
- OpenAI 工程师谈编译器 2.0:AI 作为随机优化器 — MikePFrank · 2026-09-02
- 普华永道:2050 年前全球 AI 基础设施投资将达 31.6 万亿美元 — KoseteBamse · 2026-09-02