智谱发布 GLM-5.3-Flash:混合稀疏注意力架构
No_Afternoon_4260 · reddit · 2026-08-26
Z.ai 发布了 GLM-5.3-Flash,这是 GLM-5 系列首个原生多模态模型,也是 glm5next 架构的首个开源权重版本。该模型声称价格仅为 GLM-5.2 的十分之一,但在编码和智能体基准上接近 Claude Opus 4.8。
技术亮点:
- 混合稀疏 + 线性注意力: 45 层,采用 3 层 KDA 线性注意力 + 1 层 DeepSeek 风格稀疏注意力的循环块(共 34 层线性,11 层稀疏)。稀疏层使用闪电索引器,Top-k 预算为 2048 tokens,大幅降低长上下文服务成本。
- 流形约束超连接: 采用加宽的残差流和层间流形约束混合,提升缩放效率。
- 原生多模态: 24 层 ViT 视觉编码器,支持图像和视频 Token,训练语料包含 30T 多模态 tokens。
- MTP 头部: 权重中包含 1 个 Next-N 预测层,官方 vLLM 配方使用 5 个推测 Token。
- FP8 优先: 主仓库为 FP8 (e4m3),另有单独 BF16 版本。
模型概览:
- 参数量 320B(激活 18B),MIT 许可证。
- 上下文长度 1,048,576 tokens(评测达 300K 文本 / 164K 视觉)。
- MoE 配置:288 路由专家 + 1 个共享,激活 8 个路由 + 1 个共享。
所属事件:智谱GLM-5.3-Flash模型上架Hugging Face(26 条相关)→
「模型」频道最新
- 通义 Qwen3.8 发布 Flash-Next FP8 量化版 — Qwen · 2026-08-27
- Qwen 3.8 27b 编码性能惊人,消费级硬件跑赢 GPT 5.5? — GrokiniGPT · 2026-08-27
- 智谱 GLM-5.3-Flash 深度解析:架构革新与国产算力突围 — 赛博禅心 · 2026-08-26
- 开发者试用 gpt-live-1 一小时:体验令人惊艳 — arpitingle · 2026-08-26
- 中国前沿模型齐用线性注意力,Zai 推 MIT 开源 320B 多模态模型 — ivan_bezdomny · 2026-08-26
- Qwen 3.8 27B 搭配 Fable 本地运行实测优秀 — mertdumenci · 2026-08-26