GLM-5.3-Flash 推出 DFlash 2,投机解码提速 2.8 倍
Lianhuiq · x · 2026-08-28
Inco AI 发布了 GLM-5.3-Flash 的 DFlash 2 草稿模型,通过 speculative decoding(投机解码)技术将推理速度提升了 2.8 倍。该模型采用 block-diffusion 机制,单次通过预测整块 token 并保留每个位置的最佳候选,使用双击动态卷积保持草稿质量。实测基于 SGLang 和 NVIDIA GB300,配置了 8 的推测块大小,且解码过程无损,贪婪采样结果与目标模型完全一致。
所属事件:Inco AI 发布 DFlash 2 草稿模型加速 GLM-5.3-Flash 推理(2 条相关)→
「Infra」频道最新
- 微软教程:如何在 Foundry 资源中配置 AI 网关 — adnan_hashmi · 2026-08-28
- Marin 535B-A23B 训练进度 7%,团队将分享设计决策与权衡 — bariskasikci · 2026-08-28
- 12GB 显存可跑 27B 模型,Qwen 3.8 量化实测 — Square_Light1441 · 2026-08-28
- OpenAI 推理栈全用汇编写成,传统框架正消失 — SumitGup · 2026-08-28
- 构建 OpenAI 应用时如何应对平台被黑或宕机? — Astrokanu · 2026-08-28
- 亚马逊宣布9月底关停众包平台MTurk — 量子位 · 2026-08-28