Muse Glimmer 30B 引入 DFlash,推理速度提升 2 至 4 倍

mervenoyann · x · 2026-08-11

Muse Glimmer 30B 模型现已搭载 DFlash drafter 技术。该方案在仅增加极少内存开销的情况下,能够将文本生成速度提升 2 到 4 倍。目前,llama.cpp 和 transformers 均已提供对该推理加速方案的支持。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →