中国前沿模型齐用线性注意力,Zai 推 MIT 开源 320B 多模态模型

ivan_bezdomny · x · 2026-08-26

Elie Bakouch 观察指出,除 DeepSeek 和 Kimi 外,中国所有前沿模型(如 GLM、Qwen 等)均采用了线性注意力机制和稀疏注意力设计,并普遍使用 Muon 优化器及“花哨”的残差连接(如 mHC),以最大化训练效率和信号传播。与此同时,Zai 发布了 GLM-5.3-Flash(前身为 Ox Alpha),这是一个 320B 总参数(18B 激活)的原生多模态模型,拥有 100 万 token 上下文窗口,完全基于中国 AI 芯片训练,并以 MIT 许可证开源。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →