Inco AI 发布 DFlash 2 草稿模型加速 GLM-5.3-Flash 推理
Inco AI 针对智谱 zai-org/GLM-5.3-Flash 推出 DFlash 2 草稿模型,采用块扩散(block-diffusion)技术进行推测解码(speculative decoding),可将该模型的推理速度提升约 2.8 倍,为 GLM-5.3-Flash 的实际部署提供了显著的加速方案。
2026-08-28 ~ 2026-08-28 · 2 条相关
- DFlash 2 推出块扩散推测解码,显著加速 GLM-5.3-Flash — songhan_mit · 2026-08-28
另有 1 条近重复转述:Lianhuiq