Ling-3.0-flash 开源:124B 混合线性架构 MoE 发布
NielsRogge · x · 2026-08-04
AntLingAGI 在 Hugging Face 开源了新一代原生混合推理模型 Ling-3.0-flash。
- 架构设计:采用 124B 总参数、5.1B 激活参数的 MoE 架构。从预训练阶段即原生引入混合线性架构,结合了 Kimi Delta Attention (KDA) 与 Multi-Latent Attention (MLA)。
- 性能表现:在关键基准测试中,该模型的表现与上一代持平或实现超越。
- 工程优化:原生集成 SGLang HiCache 与 Mooncake 分层缓存架构,以实现高效的 KV-cache 存储。尽管激活参数较小,但具备出色的推理、指令遵循和长上下文能力,专为生产环境中的复杂智能体工作流设计。
所属事件:Ling-3.0-flash混合架构MoE模型开源(2 条相关)→
「Infra」频道最新
- 硬件架构探讨:为何选择垂直供电而非垂直光互连? — jwt0625 · 2026-08-04
- CoreWeave官宣2026大会:李飞飞等大咖齐聚探讨生产级AI — wandb · 2026-08-04
- 智能体引爆存储变革:企业数据层正成为AI新瓶颈 — BenBajarin · 2026-08-04
- 德州州长叫停新数据中心,要求全面审查电网影响 — TechCrunch AI · 2026-08-04
- RunPod实测MiniMax H3视频模型:单卡A100生成30秒仅花0.7美元 — shadowtheimpure · 2026-08-04
- RTX 5090推理实测:限制功耗至480W,性能损失不足3% — WonderfulEagle7096 · 2026-08-04