专题 · FULL STORY
GLM-5.3-Flash:拆解与开源亮相
智谱 GLM-5.3-Flash 先被社区拆解效率来源:320B 总参数、激活参数减半,成本仅前代十分之一即超越 GLM-5.2;随后智谱正式以 MIT 协议开源该模型,作为 GLM-5 系列首个原生多模态模型登场。
2026-08-26 ~ 2026-08-28 · 2 集 · 5 条
第 1 集 · GLM-5.3-Flash效率拆解:激活参数减半,成本仅前代十分之一(2026-08-26,2 条)
社区对智谱 GLM-5.3-Flash(内部代号 Ox-Alpha)的效率来源进行了拆解:该模型以约十分之一的成本在各领域超越 GLM-5.2,总参数量保持在 GLM-4.5 的 321B 量级,但通过重构混合稀疏注意力架构,将激活参数从 32B 降至 18B,注意力计算量大幅下降。分析认为这一架构革新兼具极高性价比与性能表现,被视为国产算力突围的代表。
- 智谱 GLM-5.3-Flash 深度解析:架构革新与国产算力突围 — 赛博禅心 · 2026-08-26
- GLM-5.3-flash 效率拆解:十分之一成本胜前代,激活参数近乎减半 — baseten · 2026-08-27
第 2 集 · Zai 开源 GLM-5.3 Flash:320B 参数成本减半(2026-08-27,3 条)
Zai 发布 GLM-5.3-Flash 并基于 MIT 协议开源。作为 GLM-5 系列首个原生多模态模型,它拥有 320B 总参数、18B 激活参数、100 万 token 上下文窗口,并采用混合注意力机制,全栈在华芯上运行。在 DeepSWE 评测中性能接近此前的领先模型,且成本减半。
- Zai 开源 320B 模型 GLM-5.3-Flash,原生多模态且全在华芯运行 — ccerrato147 · 2026-08-27
- Zai 发布 GLM-5.3 Flash:320B 参数成本减半 — togethercompute · 2026-08-28
- ZAI 推出 GLM-5.3 Flash:320B 参量原声多模态 — togethercompute · 2026-08-28