GLM-5.3-Flash 推出 DFlash2 草稿模型,块扩散投机解码
TheZachMueller · x · 2026-08-28
Inco AI 在 Hugging Face 发布 GLM-5.3-Flash-DFlash2,这是 GLM-5.3-Flash 的投机解码(speculative decoding)草稿模型,不能独立运行,需部署在投机解码服务中为目标模型起草 token。
技术要点:DFlash 2 是基于块扩散(block-diffusion)的 drafter,单次前向预测一整块 token,并在每个位置保留 top 候选,再由轻量 selector 选出一条连贯路径;backbone 采用两抽头动态卷积防止草稿在块尾衰减。解码是无损的:greedy 输出与目标模型完全一致,采样也保持原分布。
官方给出 SGLang 部署方式(--speculative-algorithm DFLASH),评测环境为 4 张 GB300 GPU(TP4)、FP8 KV cache、投机块大小 8(每步验证 7 个草稿 token),采样参数 temperature 1.0、top-p 0.95。Pareto AI 的 Zach Mueller 表示周末要上手玩一下。
所属事件:Inco AI 发布 DFlash 2 草稿模型,GLM-5.3-Flash 推理提速 2.8 倍(3 条相关)→
「Infra」频道最新
- 自动研究系统发现 vLLM/SGLang 潜在数值 Bug — PMinervini · 2026-08-28
- Cloudflare 推出 BotBase 运营面板,优化 Agent 生态管理 — Cloudflare Blog · 2026-08-28
- 微星发布 72 核 Grace CPU 加持 Blackwell 工作站 — DeliciousBelt9520 · 2026-08-28
- 实测:写入时 Q8 KV 量化拖累长上下文,事后整体量化无损 — maddie-lovelace · 2026-08-28
- Apache DataFusion 55 发布:性能大幅提升 — neil_conway · 2026-08-28
- 路透社:Anthropic 曾计划 70 亿美元收购 MatX 后放弃,转谈合作 — talkingatoms · 2026-08-28