智谱开源 GLM-5.3-Flash:320B 参数性能对标 Opus,价格仅 1/40

智谱 · wechat · 2026-08-26

智谱发布并开源 GLM-5.3-Flash(320B-A18B),这是 GLM-5 系列首个原生多模态模型。其在 Artificial Analysis Intelligence Index 中取得 57 分,进入全球前沿模型区间,与 Claude Opus 4.8 持平;编程表现按 Z.ai CodeBench 体感评估也与其相当,但定价仅为 Opus 4.8 的 1/40(限时为 GLM-5.3 的 1/20)。模型在各项基准上全面超越参数量翻倍的 GLM-5.2。架构上,它采用稀疏注意力与线性注意力混合架构(首个此类开源前沿模型),并引入流形约束超连接(mHC)提升 scaling;配合 30T token 多模态预训练语料。官方还展示了视觉编码能力:模型曾自主运行 16 小时在 Blender 中搭建约 400 平方米的厨房场景,并可借助 Browser/Computer Use Agent 观察并迭代自身输出。模型上线前曾以匿名模型 Ox-Alpha 在 OpenCode 与 OpenRouter 测试,当周即登顶最受欢迎模型。值得注意的是,全部请求流量由国产芯片集群承载:智谱基于 SGLang 构建专用推理引擎,结合 W8A8 量化、混合缓存量化、EPD 分离式架构等优化,端到端性能较基线提升 3 倍,单 token 成本已与主流英伟达 GPU 相当。目前 API、GLM Coding Plan(每日限量 1 万张体验卡)与开源权重均已开放。

所属事件:智谱开源 GLM-5.3-Flash,320B 参数对标 Opus(9 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →