GLM-5.3-Flash效率拆解:激活参数减半,成本仅前代十分之一

社区对智谱 GLM-5.3-Flash(内部代号 Ox-Alpha)的效率来源进行了拆解:该模型以约十分之一的成本在各领域超越 GLM-5.2,总参数量保持在 GLM-4.5 的 321B 量级,但通过重构混合稀疏注意力架构,将激活参数从 32B 降至 18B,注意力计算量大幅下降。分析认为这一架构革新兼具极高性价比与性能表现,被视为国产算力突围的代表。

2026-08-26 ~ 2026-08-27 · 2 条相关