专题 · FULL STORY

智谱开源GLM-5.3:发布与量化跟进

智谱于8月28日前后正式开源GLM-5.3及Flash版权重,定位为当前最擅长智能体编程与网络防御的模型。发布次日,Unsloth随即推出GLM-5.3 Flash的GGUF量化版本,便于社区本地部署,事件线由官方开源延伸至社区生态跟进。

2026-08-27 ~ 2026-08-29 · 2 集 · 30 条

第 1 集 · Unsloth 发布 GLM-5.3 Flash GGUF 量化版本(2026-08-27,2 条)

Unsloth 发布了基于 zai-org/GLM-5.3-Flash 的 GGUF 格式量化模型,支持文本生成任务,采用 MIT 协议。GGUF 格式可配合 llama.cpp 等推理引擎使用,使大模型能够在消费级硬件上本地运行,同时兼容 transformers 流水线,降低了本地部署门槛。

第 2 集 · 智谱开源 GLM-5.3 与 Flash 版(2026-08-27,28 条)

智谱(Z.ai)于 8 月 28 日前后正式开放 GLM-5.3 权重,官方定位其为目前最擅长智能体编程与网络防御的模型。模型基于 GLM-5.2 同款基座,改进全部来自规模化后训练:内部 Z.ai Code Bench 上编码能力较前代提升 50%,Terminal-Bench 3.0 得分从 4.6% 跃升至 28.3%,达到开源 SOTA。同期还开源了 GLM-5.3-Flash(前称 Ox Alpha),MIT 协议、320B 总参数、18B 激活的 MoE 架构,是 GLM-5 系列首个原生多模态模型,支持 100 万 token 上下文与混合注意力机制。

已确认

  • GLM-5.3 为 743B(部分帖子写 744B)总参数的 MoE,激活参数 39B(一说 40B),MIT 许可,支持 100 万上下文窗口和 128K 最大输出
  • 模型在后训练扩展中涌现出网络安全攻防能力;Ethan Mollick 评价模型表现不错,同时强调开源模型应发布模型卡片并做红队测试
  • GLM-5.3-Flash 在 DeepSWE 评测中性能接近 Luna 模型,但同等预算下完成两倍多工作量;其前身 Ox Alpha 已完全在中国 AI 芯片上运行
  • 生态 Day-0 支持:vLLM、SGLang(多轮代理任务实测超 500 tok/s,覆盖 Blackwell/Hopper 与 AMD MI300)、Ollama 云端、Together AI、Baseten、SayGm(KubeTEEAI 支持)、Nebius Token Factory(零数据保留)
  • Unsloth 提供 GGUF 量化与本地运行指南:1-bit 版需 100GB 内存(保留 71% 精度)、3-bit 需 128GB 内存(保留 87% 精度),另有 2-bit 动态量化方案;incoai 提供 DFlash 2 投机解码 drafter(吞吐达 FP8 的 4.4 倍)与 NVFP4 量化 checkpoint,以及跑在 TokenRouter 上的方案

为什么重要

  • 在同款基座上仅靠后训练即获得 50% 编码提升并涌现安全攻防能力,是「后训练扩展」路线的有力证据
  • MIT 协议开放权重加上低至 1-bit 的量化方案,显著降低了顶级模型的本地部署门槛
  • 据 Together AI 介绍,GLM-5.3 在 100 万 token 上下文中的长程任务能力逼近 Fable 5 而成本大幅降低,为智能体工作负载提供了新的开源选择

还有 8 条相关讨论 →