中国前沿模型齐用线性注意力,Zai 推 MIT 开源 320B 多模态模型
ivan_bezdomny · x · 2026-08-26
Elie Bakouch 观察指出,除 DeepSeek 和 Kimi 外,中国所有前沿模型(如 GLM、Qwen 等)均采用了线性注意力机制和稀疏注意力设计,并普遍使用 Muon 优化器及“花哨”的残差连接(如 mHC),以最大化训练效率和信号传播。与此同时,Zai 发布了 GLM-5.3-Flash(前身为 Ox Alpha),这是一个 320B 总参数(18B 激活)的原生多模态模型,拥有 100 万 token 上下文窗口,完全基于中国 AI 芯片训练,并以 MIT 许可证开源。
「模型」频道最新
- GLM-5.3-Flash 发布:320B MoE 架构,MIT 开源 — TheZachMueller · 2026-08-27
- Claude 口头禅「这不是X而是Y」更可能来自后训练而非互联网数据 — burkov · 2026-08-27
- 307M 参数小模型 LateOn,在评测中击败 26 倍大的 Qwen — lateinteraction · 2026-08-27
- GLM-5.3-flash 效率拆解:十分之一成本胜前代,激活参数近乎减半 — baseten · 2026-08-27
- 跨模型 Token 比较无意义,推理时代指标更需细分 — adamdangelo · 2026-08-27
- Yutori 发布 n2 模型,低成本实现全桌面计算机控制 — DhruvBatra_ · 2026-08-27