智谱 GLM-5.3-Flash 发布:320B MoE 混合注意力与百万上下文

TheZachMueller · x · 2026-08-26

Zai 发布 GLM-5.3-Flash,这是 GLM-5 系列首款原生多模态模型。该模型采用 320B 总参数、18B 激活参数的 MoE 架构,结合了稀疏注意力与线性注意力,支持 100 万 token 上下文窗口。模型已获得 vLLM 首日支持,经验证可在 NVIDIA 和 AMD GPU 上运行。vLLM 团队指出,这是首个同时要求两种注意力机制并支持的模型。

所属事件:智谱开源 GLM-5.3-Flash:320B MoE 对标 Opus 4.8,价格仅 1/40(21 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →