专题 · FULL STORY
智谱开源GLM-5.3:发布与量化跟进
智谱于8月28日前后正式开源GLM-5.3及Flash版权重,定位为当前最擅长智能体编程与网络防御的模型。发布次日,Unsloth随即推出GLM-5.3 Flash的GGUF量化版本,便于社区本地部署,事件线由官方开源延伸至社区生态跟进。
2026-08-27 ~ 2026-08-29 · 2 集 · 30 条
第 1 集 · Unsloth 发布 GLM-5.3 Flash GGUF 量化版本(2026-08-27,2 条)
Unsloth 发布了基于 zai-org/GLM-5.3-Flash 的 GGUF 格式量化模型,支持文本生成任务,采用 MIT 协议。GGUF 格式可配合 llama.cpp 等推理引擎使用,使大模型能够在消费级硬件上本地运行,同时兼容 transformers 流水线,降低了本地部署门槛。
- Unsloth 推出 GLM-5.3-Flash GGUF 量化版 — unsloth · 2026-08-27
- GLM-5.3 Flash 推出 Unsloth 优化 GGUF 版本 — ElementNumber6 · 2026-08-27
第 2 集 · 智谱开源 GLM-5.3 与 Flash 版(2026-08-27,28 条)
智谱(Z.ai)于 8 月 28 日前后正式开放 GLM-5.3 权重,官方定位其为目前最擅长智能体编程与网络防御的模型。模型基于 GLM-5.2 同款基座,改进全部来自规模化后训练:内部 Z.ai Code Bench 上编码能力较前代提升 50%,Terminal-Bench 3.0 得分从 4.6% 跃升至 28.3%,达到开源 SOTA。同期还开源了 GLM-5.3-Flash(前称 Ox Alpha),MIT 协议、320B 总参数、18B 激活的 MoE 架构,是 GLM-5 系列首个原生多模态模型,支持 100 万 token 上下文与混合注意力机制。
已确认
- GLM-5.3 为 743B(部分帖子写 744B)总参数的 MoE,激活参数 39B(一说 40B),MIT 许可,支持 100 万上下文窗口和 128K 最大输出
- 模型在后训练扩展中涌现出网络安全攻防能力;Ethan Mollick 评价模型表现不错,同时强调开源模型应发布模型卡片并做红队测试
- GLM-5.3-Flash 在 DeepSWE 评测中性能接近 Luna 模型,但同等预算下完成两倍多工作量;其前身 Ox Alpha 已完全在中国 AI 芯片上运行
- 生态 Day-0 支持:vLLM、SGLang(多轮代理任务实测超 500 tok/s,覆盖 Blackwell/Hopper 与 AMD MI300)、Ollama 云端、Together AI、Baseten、SayGm(KubeTEEAI 支持)、Nebius Token Factory(零数据保留)
- Unsloth 提供 GGUF 量化与本地运行指南:1-bit 版需 100GB 内存(保留 71% 精度)、3-bit 需 128GB 内存(保留 87% 精度),另有 2-bit 动态量化方案;incoai 提供 DFlash 2 投机解码 drafter(吞吐达 FP8 的 4.4 倍)与 NVFP4 量化 checkpoint,以及跑在 TokenRouter 上的方案
为什么重要
- 在同款基座上仅靠后训练即获得 50% 编码提升并涌现安全攻防能力,是「后训练扩展」路线的有力证据
- MIT 协议开放权重加上低至 1-bit 的量化方案,显著降低了顶级模型的本地部署门槛
- 据 Together AI 介绍,GLM-5.3 在 100 万 token 上下文中的长程任务能力逼近 Fable 5 而成本大幅降低,为智能体工作负载提供了新的开源选择
- Zai 开源 320B 模型 GLM-5.3-Flash,原生多模态且全在华芯运行 — ccerrato147 · 2026-08-27
- GLM-5.3-Flash 本地运行指南:128GB 内存跑 3-bit 量化 — StefanoGogioso · 2026-08-27
- Zai 发布 GLM-5.3 Flash:320B 参数成本减半 — togethercompute · 2026-08-28
- ZAI 推出 GLM-5.3 Flash:320B 参量原声多模态 — togethercompute · 2026-08-28
- GLM-5.3-Flash 模型开源:320B 参数 MoE 架构,MIT 协议 — arankomatsuzaki · 2026-08-28
- 智谱 GLM-5.3 开放权重:主打智能体编码与网络防御 — scaling01 · 2026-08-28
- Ollama 上线智谱 GLM-5.3-Flash:18B 激活参数、1M 上下文 — ollama · 2026-08-28
- zai 发布 GLM-5.3 开源模型,主打智能体编程与防御 — zai-org · 2026-08-28
- GLM-5.3 发布:编程能力提升 50%,涌现网络安全攻防技能 — jacek2023 · 2026-08-28
- 智谱 GLM-5.3 开源发布,同步推出 Flash 版本 — 赛博禅心 · 2026-08-28
- Inferact 发布 GLM-5.3 NVFP4 版本,显存占用降 38% — vllm_project · 2026-08-28
- GLM-5.3 开放权重:专攻代理编程与网络防御 — shaunralston · 2026-08-28
- GLM-5.3 开放权重: SGLang 实测多轮代理任务超 500 tok/s — BanghuaZ · 2026-08-28
- Zai发布最强编码模型GLM-5.3开源权,被指未做安全测试 — dhadfieldmenell · 2026-08-28
- GLM 5.3 开源权重亮相,DFlash 2 投机解码吞吐达 FP8 的 4.4 倍 — gan_chuang · 2026-08-29
- GLM 5.3 开源,NVFP4 检查点吞吐量提升 4.4 倍 — songhan_mit · 2026-08-29
- GLM-5.3 发布:MIT 许可,主打 Agent 编程与安全分析 — baseten · 2026-08-29
- GLM-5.3 开源,Unsloth 助力本地运行与大幅压缩 — danielhanchen · 2026-08-29
- GLM-5.3 开源:50% 编码提升,现身漏洞挖掘能力 — gharik · 2026-08-29
- GLM-5.3 开源:支持 100 万上下文,vLLM 首发 — AccBalanced · 2026-08-29