GLM-5.3-Flash 推出 DFlash 2,投机解码提速 2.8 倍

Lianhuiq · x · 2026-08-28

Inco AI 发布了 GLM-5.3-Flash 的 DFlash 2 草稿模型,通过 speculative decoding(投机解码)技术将推理速度提升了 2.8 倍。该模型采用 block-diffusion 机制,单次通过预测整块 token 并保留每个位置的最佳候选,使用双击动态卷积保持草稿质量。实测基于 SGLang 和 NVIDIA GB300,配置了 8 的推测块大小,且解码过程无损,贪婪采样结果与目标模型完全一致。

所属事件:Inco AI 发布 DFlash 2 草稿模型加速 GLM-5.3-Flash 推理(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →