GLM-5.3-Flash 采用稀疏+线性注意力混合架构
multimodalart · x · 2026-08-26
除了 Qwen3.8-Flash-Next 外,新发布的 GLM-5.3-Flash 基于重新设计的基础模型和训练配方。其采用稀疏与线性注意力混合架构,在保持精确长上下文能力的同时,大幅降低了长上下文服务的成本。
所属事件:智谱发布 GLM-5.3-Flash:320B MoE 架构支持百万上下文(3 条相关)→
「模型」频道最新
- Baseten 支持 GLM-5.3-Flash 进行 RL 与微调 — baseten · 2026-08-26
- Nous Portal 上线 GLM-5.3-Flash 模型 — NousResearch · 2026-08-26
- ZAI 0xAlpha 集成多项创新,推理成本降 10 倍 — zephyr_z9 · 2026-08-26
- OpenRouter GLM-5.3 Flash 上线,接棒 Ox Alpha — Teknium · 2026-08-26
- Qwen 技术报告获赞:细节严谨,N-gram 方法或成标准 — code_star · 2026-08-26
- 智谱 GLM-5.3-Flash 发布:320B MoE 混合注意力与百万上下文 — TheZachMueller · 2026-08-26