GLM 5.3 开源,NVFP4 检查点吞吐量提升 4.4 倍
songhan_mit · x · 2026-08-29
Zai 发布 GLM 5.3 开放权重模型。IncoAI 团队同步发布 Day 0 支持方案,合作实现了多项推理优化:
- DFlash 2 Drafter:推测解码加速。
- NVFP4 Checkpoint:使用 NVFP4 格式检查点,优化显存与计算。
- Live Endpoint:基于 TokenRouter 的 GB300s 实时端点。
实测显示,在自回归解码中,该方案相比原生 FP8 可实现最高 4.4 倍的吞吐量提升。
所属事件:GLM 5.3 开放权重发布,配套解码与量化方案亮相(2 条相关)→
「Infra」频道最新
- Microduck 硬件成本分析:$10 售价是否可行? — NickPassig · 2026-08-29
- 双 3090 跑通 Qwen3.8-27B:DFlash2 加速实测与全流程配置 — Old_Ad_6033 · 2026-08-29
- 观点文章:数据中心是下一代港口,社区将围绕智能流动而建 — McDonaghMatthew · 2026-08-29
- 科普视频拆解:为什么数据中心反而能拉低电价 — aronchick · 2026-08-29
- Mac Studio M5 Ultra 选配探讨:双 96GB 互联优于单 256GB? — anonmt57 · 2026-08-29
- Polymarket:美国某州年内立法暂停新数据中心概率 68% — Polymarket · 2026-08-29