专题 · FULL STORY
智谱开源GLM-5.3-Flash:发布与实测
智谱于8月25日正式发布并以MIT协议开源GLM-5.3-Flash,320B MoE架构,成本降低约90%。发布后引发社区实测热潮,多项评测显示其性能比肩GPT-5.6,成为开源阵营又一焦点。
2026-08-25 ~ 2026-08-27 · 2 集 · 50 条
第 1 集 · 智谱开源 GLM-5.3-Flash:320B 多模态 MoE,成本降约 90%(2026-08-25,48 条)
智谱于 8 月 25-26 日正式发布 GLM-5.3-Flash(代号 Ox Alpha),并以 MIT 协议在 Hugging Face 开源。这是 GLM-5 系列首个原生多模态模型,也是 glm5next 架构的首个开源权重版本,主打「前沿智能 + Flash 极速成本」,官方称成本较 GLM-5.2 降低约 90%(价格约为十分之一),发布当日即引发大量关注与转发,目前已上架 Hugging Face、Cloudflare Workers AI 与 Baseten 等平台。
已确认
- 架构与规模:320B 总参数、18B 激活参数的稀疏 MoE 架构,融合 Kimi Linear 混合注意力与 DeepSeek 相关技术(稀疏注意力 + 线性注意力),原生多模态,支持 100 万 token 上下文,已获 vLLM 支持(@NoAfternoon4260、@TheZachMueller 等)
- 定价:官方标准 API 定价为每 100 万 tokens 输入 $0.15、输出 $0.50、缓存输入 $0.03(@Zaiorg 官宣,@bindureddy、@ramagetime 等转述);@bindureddy 认为该价格低于 DeepSeek Flash Vision,有潜力成为使用最广泛的开源 AI 模型
- 性能表现:@Zaiorg 称在 Code Bench 真实编码基准中所有算力等级均显著超越 GLM-5.2,与 Claude Opus 4.8 持平;Artificial Analysis 智力指数得分 57,仅比完整版 GLM-5.3 低 3 分,与 GPT-5 等对比后仍与完整版同处 Pareto 前沿(@ArtificialAnlys、@ollama 转述);@Zaiorg 还表示架构增强与优化的预训练语料使其以更少算力提供更高智能
- 硬件部署:@zephyrz9 称模型 FP8 权重约 328GB,部署于昇腾硬件且尚未使用 NVFP4;@orange 转述官方说法,每日超 100T 算力供应全部由国产芯片支撑,并以 Opus 4.8 约 1/40 的价格形容其性价比
- 开源与分发:模型已上架 Hugging Face(@zai-org、@coder543),MIT 许可,可通过 Transformers 框架下载使用,具备多语言能力;@michellechen 确认其登陆 Cloudflare Workers AI,@baseten 也宣布提供该模型服务
尚未确认
- 具体基准数据的第三方复现结果尚待更多独立评测;性能对比(如追平 Opus 4.8)目前主要来自官方博客与 Artificial Analysis 初步评测;「全部算力由国产芯片支撑」亦来自官方转述,尚无独立验证
为什么重要
- 参数量不到 GLM-5.2 的一半却官方宣称全面超越上代,配合极低定价,@bindureddy 认为其有潜力成为使用最广泛的开源模型;@Hesamation 测算单任务成本约 $0.045,比 GLM-5.3 便宜 15 倍、比 Opus 4.8 便宜约 45 倍
- 全部推理算力由国产芯片支撑的说法若属实,将对行业算力供给格局产生重要影响
- @kimmonismus 将其与 Qwen3.8-Flash-Next(125B MoE、6B 激活,在 8/9 项基准击败 Claude Opus 4.6 Max)并列,视为开源与本地 AI 对闭源旗舰形成实质竞争的标志
- Zai 在 Hugging Face 发布 GLM-5.3-Flash 模型 — zai-org · 2026-08-25
- 智谱开源 GLM-5.3-Flash:320B 参数性能对标 Opus,价格仅 1/40 — 智谱 · 2026-08-26
- Zai 发布 GLM-5.3-Flash 定价:输入 0.15 美元 — Zai_org · 2026-08-26
- GLM-5.3-Flash 编程性能追平 Claude Opus 4.8 — Zai_org · 2026-08-26
- 架构升级使 GLM-5.3-Flash 更智能更省算 — Zai_org · 2026-08-26
- Zai 推出 320B 参数 GLM-5.3-Flash 模型 — TheZachMueller · 2026-08-26
- 智谱发布 GLM-5.3-Flash:320B 参数 MIT 开源 — TheZachMueller · 2026-08-26
- 智谱疑似悄然发布 glm-5.3-flash 模型 — koltregaskes · 2026-08-26
- 智谱 GLM-5.3-Flash 模型发布于 Hugging Face — coder543 · 2026-08-26
- 智谱 GLM-5.3-Flash 发布:性能超 Opus 4.8,体积更小 — airesearch12 · 2026-08-26
- GLM-5.3-Flash 采用混合注意力降成本 — multimodalart · 2026-08-26
- GLM-5.3-Flash 采用稀疏+线性注意力混合架构 — multimodalart · 2026-08-26
- 智谱发布 GLM-5.3-Flash:前沿智能与极速成本 — dydynam · 2026-08-26
- 智谱发布GLM 5.3 Flash Vision:320B参数、价格仅Opus 4.8的1/40 — oran_ge · 2026-08-26
- GLM-5.3 Flash 曝光:320B 总参数 18B 激活,部署于昇腾 — zephyr_z9 · 2026-08-26
- 智谱GLM 5.3发布:国产芯片日供百T算力,成本降至前代1/10 — oran_ge · 2026-08-26
- 智谱 GLM-5.3-Flash 发布:基准测试数据出炉 — elemental-mind · 2026-08-26
- 智谱 GLM 5.3 Flash 发布:320B 参数,价格打一折 — oran_ge · 2026-08-26
- 智谱 GLM-5.3-Flash 发布:320B MoE 混合注意力与百万上下文 — TheZachMueller · 2026-08-26
- 智谱 GLM-5.3-Flash 开源:320B 参数 MIT 协议 — realsohamparekh · 2026-08-26
第 2 集 · 实测 GLM-5.3 Flash 性能比肩 GPT-5.6 且成本极低(2026-08-27,2 条)
GLM-5.3 Flash 发布后引发实测热潮。Zain Hasan 称其在 AA Agentic Index 上得分 58,达到 GPT-5.6 Sol 的水平,而每个任务成本极低。另有用户在 LM Studio 上进行长时间测试,反馈模型表现优异,累计仅花费 20 美分,性价比突出。
- GLM-5.3 Flash 评测:GPT-5.6 级别且成本极低 — zainhas · 2026-08-27
- 实测 GLM-5.3 Flash:模型表现优异且成本极低 — AIandDesign · 2026-08-27