仅激活 5.1B 参数,蚂蚁 Ling-3.0-flash 架构与成本深度解析
jkris050 · reddit · 2026-08-05
蚂蚁集团旗下实验室 inclusionAI 于 8 月 4 日以 MIT 协议开源了 Ling-3.0-flash 模型。该模型总参数 124B,但每个 token 仅激活 5.1B(约 1/64),采用 512 个路由专家加 1 个共享专家的架构。
架构亮点:
- 从预训练初期就原生采用混合线性注意力,而非后期改造。
- 包含 35 层 KDA 交替 5:1 的 7 层门控 MLA。
性能与成本争议:
- 实验室自称其性能可媲美甚至超越自家 1T 参数的旗舰模型 Ring-2.6-1T。
- 发帖人指出,如果能将激活参数缩减 12 倍且不损失性能,这重新定义了“廉价模型”的概念——它不再是降级版,而是相同能力下更高效的计算。
- 部署痛点: 目前缺乏 GGUF 和 llama.cpp 支持,需在 4 张 GPU 上运行定制版 vLLM/SGLang。虽然运行成本低,但 124B 的权重意味着显存(VRAM)拥有成本依然高昂。
所属事件:蚂蚁 Ling-3.0-flash 开源:124B MoE 仅激活 5.1B(5 条相关)→
「Infra」频道最新
- Astera Labs 预测:NPO 将于 2027 年部署,CPO 随后在 2028 年落地 — bookwormengr · 2026-08-05
- 美国芯片出口管制适得其反,反倒助推中国设备厂崛起 — kevinsxu · 2026-08-05
- TriAttention 集成至 TensorRT-LLM,优化长文本推理显存 — songhan_mit · 2026-08-05
- 单季AI投入超千亿,SpaceX财报后股价一夜蒸发八千亿 — 智东西 · 2026-08-05
- 前 OpenAI 高管驳高盛预测:推理成本将暴降百倍,token 是极差计量单位 — ChrSzegedy · 2026-08-05
- SK海力士与三星评估在华工厂引入中微刻蚀机 — zephyr_z9 · 2026-08-05