Ling-3.0 混合架构曝光:原生支持 256K 上下文

SonglinYang4 · x · 2026-07-24

AntLingAGI 透露了 Ling-3.0 模型的最新架构细节,该模型采用了原生混合线性注意力机制。

核心设计在于将 KDA(细粒度长程记忆控制)与 MLA 层以 5:1 的比例进行堆叠。这种混合架构不仅优化了长文本处理能力,还通过 1/64 的专家激活率大幅提升了 MoE(混合专家)的计算效率。

据称,Ling-3.0 原生支持 256K 的上下文长度,并且具备进一步扩展至 1M 的潜力。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →