智谱 GLM-5.3-Flash 发布:320B MoE 混合注意力与百万上下文
TheZachMueller · x · 2026-08-26
Zai 发布 GLM-5.3-Flash,这是 GLM-5 系列首款原生多模态模型。该模型采用 320B 总参数、18B 激活参数的 MoE 架构,结合了稀疏注意力与线性注意力,支持 100 万 token 上下文窗口。模型已获得 vLLM 首日支持,经验证可在 NVIDIA 和 AMD GPU 上运行。vLLM 团队指出,这是首个同时要求两种注意力机制并支持的模型。
所属事件:智谱开源 GLM-5.3-Flash:320B MoE 对标 Opus 4.8,价格仅 1/40(21 条相关)→
「模型」频道最新
- 网友晒图吐槽 Gemini 表现糟糕:Gemini you are fired — dh7net · 2026-08-26
- 用户发现特定提示词可触发 Opus 4.6 及 GPT Image 1.5 — koltregaskes · 2026-08-26
- Qwen3.8-Flash-Next 跻身 Code Arena 前八,WebDev 超强 — arena · 2026-08-26
- GLM-5.3-Flash 日处理 100T tokens,竟全靠国产芯片 — airesearch12 · 2026-08-26
- 中国实验室高效整合创新,ZAI 复用同行技术降低成本 — PAstynome · 2026-08-26
- Claude Fable 5 模型开始向 Fable 5.1 路由 — legit_api · 2026-08-26