智谱开源GLM-5.3-Flash:320B MoE、性能追平Opus 4.8
智谱 AI 于 8 月 26 日正式发布并开源 GLM-5.3-Flash,即此前在 OpenRouter 上以 Ox Alpha 之名低调测试的神秘模型。该模型以 MIT 协议在 Hugging Face 开放权重,主打前沿性能与极低成本的组合,发布当天即引发社区大量讨论。
已确认
- 规格与架构:320B 总参数、18B 激活的 MoE 架构,是 glm5next 架构的首个开源权重版本;采用稀疏注意力与线性注意力混合机制,原生多模态,支持 100 万 token 上下文窗口;FP8 权重约占 328GB。
- 性能:官方称在 Code Bench 真实编码基准上全面超越 GLM-5.2、与 Claude Opus 4.8 持平;第三方 Artificial Analysis 智力指数给出 57 分,与完整版 GLM-5.3 一同位于 Pareto 前沿;据 op7418 转述,其预览期在 OpenRouter 已消耗 23.2T tokens,终结了 DeepSeek 的霸榜纪录。
- 定价:官方 API 标准定价为每 100 万 tokens 输入 0.15 美元、输出 0.50 美元、缓存输入 0.03 美元。多个帖子称其价格约为 GLM-5.2 或完整版 GLM-5.3 的十分之一至十五分之一,较 Opus 4.8 便宜约 40 余倍;Hesamation 的评测转述称单任务成本约 0.045 美元。
- 生态:已获得 vLLM 支持,Hugging Face 页面基于 Transformers 框架。
- 算力:据 orange 等帖转述,官方称每日超 100T tokens 的供应量由国产(昇腾)芯片支撑;zephyrz9 称该模型部署在昇腾硬件上,FP8 权重约 328GB,目前尚未使用 NVFP4。
尚未确认
- 「全球每日超 100T 供应量全部由国产芯片支撑」及部分性价比倍数说法来自官方宣传或社区转述,暂无独立验证。
为什么重要
- 参数量不到 GLM-5.2 一半却在各基准全面超越上代,配合激进定价,对闭门前沿模型的性价比构成直接冲击;混合稀疏/线性注意力路线显著压低长上下文服务成本,为开源社区提供了新的架构范本。
2026-08-25 ~ 2026-08-26 · 26 条相关
- 第 1 集:隐身模型 Ox Alpha 引爆社区:指纹指向智谱 GLM-5.3(2026-08-21,58 条)
- 第 2 集:OpenRouter 神秘模型 Ox Alpha 被识别为 GLM(2026-08-21,3 条)
- 第 3 集:Cola 发布 Ox 模型 宣称 Terra 级能力 Flash 级速度(2026-08-21,2 条)
- 第 4 集:神秘模型 Ox Alpha 免费送出百万亿 token 引算力质疑(2026-08-21,2 条)
- 第 5 集:Ox-Alpha 模型实测不佳被指营销噱头(2026-08-22,3 条)
- 第 6 集:Ox Alpha 完整 DeepSWE 实测约 63%,此前 80% 系子集误报(2026-08-22,6 条)
- 第 7 集:取证揭秘:匿名模型 Ox Alpha 被多方证实为智谱 GLM(2026-08-22,31 条)
- 第 8 集:Ox Alpha 单次生成6.4万token构建3D场景(2026-08-22,2 条)
- 第 9 集:神秘模型 Ox Alpha 实测口碑两极分化(2026-08-22,6 条)
- 第 10 集:神秘模型 Ox Alpha 免费上线,真实身份成谜(2026-08-23,3 条)
- 第 11 集:匿名模型 Ox Alpha 登陆 OpenRouter 引发热议(2026-08-24,5 条)
- 第 12 集:爆料称Ox Alpha即GLM-5.3 Flash:320B参数价格打一折(2026-08-25,4 条)
- 第 13 集:神秘登顶模型 Ox Alpha 实为智谱 GLM-5.3-Flash,今晚开源权重(2026-08-25,16 条)
- 第 14 集:智谱开源GLM-5.3-Flash:320B MoE、性能追平Opus 4.8(2026-08-25,26 条)
- 第 15 集:隐身模型 Ox Alpha 编码实测平平,修复率不及 Grok 4.6(2026-08-25,3 条)
- 第 16 集:神秘模型 Ox Alpha 六天狂耗 42T tokens 引猜测(2026-08-26,3 条)
一手来源
- Zai 在 Hugging Face 发布 GLM-5.3-Flash 模型 — zai-org ·
- GLM-5.3-Flash 编程性能追平 Claude Opus 4.8 — Zai_org ·
- Zai 发布 GLM-5.3-Flash 定价:输入 0.15 美元 — Zai_org ·
- 【源头】Zai 在 Hugging Face 发布 GLM-5.3-Flash 模型 — zai-org · 2026-08-25
- 智谱开源 GLM-5.3-Flash:320B 参数性能对标 Opus,价格仅 1/40 — 智谱 · 2026-08-26
- 【源头】Zai 发布 GLM-5.3-Flash 定价:输入 0.15 美元 — Zai_org · 2026-08-26
- 【源头】GLM-5.3-Flash 编程性能追平 Claude Opus 4.8 — Zai_org · 2026-08-26
- 架构升级使 GLM-5.3-Flash 更智能更省算 — Zai_org · 2026-08-26
- Zai 推出 320B 参数 GLM-5.3-Flash 模型 — TheZachMueller · 2026-08-26
- 智谱发布 GLM-5.3-Flash:320B 参数 MIT 开源 — TheZachMueller · 2026-08-26
- 智谱疑似悄然发布 glm-5.3-flash 模型 — koltregaskes · 2026-08-26
- 智谱 GLM-5.3-Flash 模型发布于 Hugging Face — coder543 · 2026-08-26
- 智谱 GLM-5.3-Flash 发布:性能超 Opus 4.8,体积更小 — airesearch12 · 2026-08-26
- GLM-5.3-Flash 采用混合注意力降成本 — multimodalart · 2026-08-26
- GLM-5.3-Flash 采用稀疏+线性注意力混合架构 — multimodalart · 2026-08-26
- 智谱发布 GLM-5.3-Flash:前沿智能与极速成本 — dydynam · 2026-08-26
- 智谱发布GLM 5.3 Flash Vision:320B参数、价格仅Opus 4.8的1/40 — oran_ge · 2026-08-26
- GLM-5.3 Flash 曝光:320B 总参数 18B 激活,部署于昇腾 — zephyr_z9 · 2026-08-26
- 智谱GLM 5.3发布:国产芯片日供百T算力,成本降至前代1/10 — oran_ge · 2026-08-26
- 智谱 GLM-5.3-Flash 发布:基准测试数据出炉 — elemental-mind · 2026-08-26
- 智谱 GLM 5.3 Flash 发布:320B 参数,价格打一折 — oran_ge · 2026-08-26
- 智谱 GLM-5.3-Flash 发布:320B MoE 混合注意力与百万上下文 — TheZachMueller · 2026-08-26
- 智谱 GLM-5.3-Flash 开源:320B 参数 MIT 协议 — realsohamparekh · 2026-08-26
- GLM-5.3-Flash 获评 57 分,登顶 Pareto 前沿 — ollama · 2026-08-26
- GLM-5.3-Flash 性能持平 Opus 4.8 但便宜 45 倍 — Hesamation · 2026-08-26
- 智谱 GLM-5.3-Flash 公开:320B 参数 MIT 开源 — op7418 · 2026-08-26
- 智谱发布 GLM-5.3-Flash:混合稀疏注意力架构 — No_Afternoon_4260 · 2026-08-26
- Qwen 与 GLM 新模型实测赶超 Claude Opus — kimmonismus · 2026-08-26
- GLM-5.3-Flash 发布:320B 规模 MIT 开源,性能超上代 — matei_zaharia · 2026-08-26