Ling-3.0 混合架构曝光:原生支持 256K 上下文
SonglinYang4 · x · 2026-07-24
AntLingAGI 透露了 Ling-3.0 模型的最新架构细节,该模型采用了原生混合线性注意力机制。
核心设计在于将 KDA(细粒度长程记忆控制)与 MLA 层以 5:1 的比例进行堆叠。这种混合架构不仅优化了长文本处理能力,还通过 1/64 的专家激活率大幅提升了 MoE(混合专家)的计算效率。
据称,Ling-3.0 原生支持 256K 的上下文长度,并且具备进一步扩展至 1M 的潜力。
「模型」频道最新
- Claude Opus 5 据称价格减半并刷榜 Frontier-Bench — GregCook2011 · 2026-07-27
- 研究者称防御场景更偏向开放模型,Kimi K3 已接近高水平网络安全能力 — eliebakouch · 2026-07-27
- Opus 5 连自己生成的游戏不好看都能察觉 — Angaisb_ · 2026-07-27
- Opus 5 深夜聊天时反过来追问用户动机 — repligate · 2026-07-27
- Opus 3 和 Sonnet 3 上演了一场荒诞跨界对话 — repligate · 2026-07-27
- Kimi K3 登陆 Together,预留吞吐成本低 65% — togethercompute · 2026-07-27