专题 · FULL STORY

智谱开源GLM-5.3-Flash:发布与实测

智谱于8月25日正式发布并以MIT协议开源GLM-5.3-Flash,320B MoE架构,成本降低约90%。发布后引发社区实测热潮,多项评测显示其性能比肩GPT-5.6,成为开源阵营又一焦点。

2026-08-25 ~ 2026-08-27 · 2 集 · 50 条

第 1 集 · 智谱开源 GLM-5.3-Flash:320B 多模态 MoE,成本降约 90%(2026-08-25,48 条)

智谱于 8 月 25-26 日正式发布 GLM-5.3-Flash(代号 Ox Alpha),并以 MIT 协议在 Hugging Face 开源。这是 GLM-5 系列首个原生多模态模型,也是 glm5next 架构的首个开源权重版本,主打「前沿智能 + Flash 极速成本」,官方称成本较 GLM-5.2 降低约 90%(价格约为十分之一),发布当日即引发大量关注与转发,目前已上架 Hugging Face、Cloudflare Workers AI 与 Baseten 等平台。

已确认

  • 架构与规模:320B 总参数、18B 激活参数的稀疏 MoE 架构,融合 Kimi Linear 混合注意力与 DeepSeek 相关技术(稀疏注意力 + 线性注意力),原生多模态,支持 100 万 token 上下文,已获 vLLM 支持(@NoAfternoon4260、@TheZachMueller 等)
  • 定价:官方标准 API 定价为每 100 万 tokens 输入 $0.15、输出 $0.50、缓存输入 $0.03(@Zaiorg 官宣,@bindureddy、@ramagetime 等转述);@bindureddy 认为该价格低于 DeepSeek Flash Vision,有潜力成为使用最广泛的开源 AI 模型
  • 性能表现:@Zaiorg 称在 Code Bench 真实编码基准中所有算力等级均显著超越 GLM-5.2,与 Claude Opus 4.8 持平;Artificial Analysis 智力指数得分 57,仅比完整版 GLM-5.3 低 3 分,与 GPT-5 等对比后仍与完整版同处 Pareto 前沿(@ArtificialAnlys、@ollama 转述);@Zaiorg 还表示架构增强与优化的预训练语料使其以更少算力提供更高智能
  • 硬件部署:@zephyrz9 称模型 FP8 权重约 328GB,部署于昇腾硬件且尚未使用 NVFP4;@orange 转述官方说法,每日超 100T 算力供应全部由国产芯片支撑,并以 Opus 4.8 约 1/40 的价格形容其性价比
  • 开源与分发:模型已上架 Hugging Face(@zai-org、@coder543),MIT 许可,可通过 Transformers 框架下载使用,具备多语言能力;@michellechen 确认其登陆 Cloudflare Workers AI,@baseten 也宣布提供该模型服务

尚未确认

  • 具体基准数据的第三方复现结果尚待更多独立评测;性能对比(如追平 Opus 4.8)目前主要来自官方博客与 Artificial Analysis 初步评测;「全部算力由国产芯片支撑」亦来自官方转述,尚无独立验证

为什么重要

  • 参数量不到 GLM-5.2 的一半却官方宣称全面超越上代,配合极低定价,@bindureddy 认为其有潜力成为使用最广泛的开源模型;@Hesamation 测算单任务成本约 $0.045,比 GLM-5.3 便宜 15 倍、比 Opus 4.8 便宜约 45 倍
  • 全部推理算力由国产芯片支撑的说法若属实,将对行业算力供给格局产生重要影响
  • @kimmonismus 将其与 Qwen3.8-Flash-Next(125B MoE、6B 激活,在 8/9 项基准击败 Claude Opus 4.6 Max)并列,视为开源与本地 AI 对闭源旗舰形成实质竞争的标志

还有 28 条相关讨论 →

第 2 集 · 实测 GLM-5.3 Flash 性能比肩 GPT-5.6 且成本极低(2026-08-27,2 条)

GLM-5.3 Flash 发布后引发实测热潮。Zain Hasan 称其在 AA Agentic Index 上得分 58,达到 GPT-5.6 Sol 的水平,而每个任务成本极低。另有用户在 LM Studio 上进行长时间测试,反馈模型表现优异,累计仅花费 20 美分,性价比突出。