DFlash 2 推出块扩散推测解码,显著加速 GLM-5.3-Flash
songhan_mit · x · 2026-08-28
Inco AI 发布了 DFlash 2 草稿模型,利用块扩散(block-diffusion)技术进行推测解码,旨在加速 zai-org/GLM-5.3-Flash 的推理速度。
- 技术原理:DFlash 2 不是一个独立的语言模型,它在推测解码服务器内运行,通过单次传递预测整块令牌,并使用双击动态卷积保持草稿质量,确保无损解码(贪婪输出与目标模型完全一致)。
- 部署方式:需配合 SGLang 使用,通过指定 speculative-algorithm 为 DFLASH 加载。
- 性能评测:在 GB300 GPU 上的测试显示,该方案在保持官方推荐采样参数(temperature 1.0, top-p 0.95)的同时,显著提升了吞吐量,尤其是在高并发场景下。
所属事件:Inco AI 发布 DFlash 2 草稿模型加速 GLM-5.3-Flash 推理(2 条相关)→
「Infra」频道最新
- AI数据中心被指高耗水?实测数据揭示闭环设计真相 — robleclerc · 2026-08-28
- 实测 M3 Max 跑通 125B Qwen 模型,推理速度达 70tok/s — mayfer · 2026-08-28
- NVIDIA 推出 Mesh 开源计算网络,聚合闲置 GPU 跑 AI — nvidia · 2026-08-28
- AI 自动化研究发现 vLLM/SGLang 底层数值错误 — josh_tobin_ · 2026-08-28
- Hot Chips 观察:推理芯片进入「群雄 ferment 时代」 — BenBajarin · 2026-08-28
- 实测 Muon 优化器:残差梯度平滑且稳定 — stochasticchasm · 2026-08-28