GLM-5.3-Flash 推出 DFlash2 草稿模型,块扩散投机解码

TheZachMueller · x · 2026-08-28

Inco AI 在 Hugging Face 发布 GLM-5.3-Flash-DFlash2,这是 GLM-5.3-Flash 的投机解码(speculative decoding)草稿模型,不能独立运行,需部署在投机解码服务中为目标模型起草 token。

技术要点:DFlash 2 是基于块扩散(block-diffusion)的 drafter,单次前向预测一整块 token,并在每个位置保留 top 候选,再由轻量 selector 选出一条连贯路径;backbone 采用两抽头动态卷积防止草稿在块尾衰减。解码是无损的:greedy 输出与目标模型完全一致,采样也保持原分布。

官方给出 SGLang 部署方式(--speculative-algorithm DFLASH),评测环境为 4 张 GB300 GPU(TP4)、FP8 KV cache、投机块大小 8(每步验证 7 个草稿 token),采样参数 temperature 1.0、top-p 0.95。Pareto AI 的 Zach Mueller 表示周末要上手玩一下。

所属事件:Inco AI 发布 DFlash 2 草稿模型,GLM-5.3-Flash 推理提速 2.8 倍(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →