开发者实测拆解 GLM-5.3 Flash:320B 总参 18B 激活,12096 个专家单元
teortaxesTex · x · 2026-09-03
开发者 superalesha 宣布把 GLM-5.3 Flash 的 NVFP4 部署检查点完整拆进 Weight Atlas 可视化工具:不是读配置文件,而是在 4x RTX PRO 6000 上实际运行模型逐一测量。
拆解发现:
- 320B 总参数、18B 激活,45 层语言层 + 24 块视觉塔;
- 12,096 个专家单元(42 层 × 每层 288 个专家),每个专家都有基于每层 1259 万 token 计算的精确 REAP 重要性、路由份额与输出贡献;
- 数据可按 14 个领域切片浏览,包括俄语和视觉部分。
teortaxesTex 引用感叹:这些测量能让研究者构建什么样的分析工具?这是对开源权重 MoE 模型内部结构的一次罕见公开深挖。
「模型」频道最新
- Baseten 上线 GLM-5.3 Fast:开源权重强模型提速,面向实时场景 — baseten · 2026-09-03
- 多位用户反馈 Claude 近期错误频出,幻觉问题成日常 — lilyraynyc · 2026-09-03
- 首次实测 Gemini 3.8 Flash 翻车:一直思考直到超时 — rickasaurus · 2026-09-03
- 用户反馈:fable 5 好用程度胜过 fable 5.1 — BLUECOW009 · 2026-09-03
- 用户实测 Flash 3.8:能力出色但会陷入静默死循环烧 token — brandon_galang · 2026-09-03
- 用户吐槽 Claude Max 20x 限额不清:周限额才是真瓶颈,发帖被删 — conorearly · 2026-09-03