Muse Glimmer 30B 引入 DFlash,推理速度提升 2 至 4 倍
mervenoyann · x · 2026-08-11
Muse Glimmer 30B 模型现已搭载 DFlash drafter 技术。该方案在仅增加极少内存开销的情况下,能够将文本生成速度提升 2 到 4 倍。目前,llama.cpp 和 transformers 均已提供对该推理加速方案的支持。
「Infra」频道最新
- NVIDIA Nemotron 3.5 Lightning 上线 DeepInfra,支持百万 tokens — gharik · 2026-08-11
- 中国 DRAM 一哥 CXMT 纳入 MSCI 中国指数,有望吸引大量资金 — pstAsiatech · 2026-08-11
- OpenAI承诺助力德州电网:将支持新增电力与基础设施建设 — pstAsiatech · 2026-08-11
- MiniMax H3 视频生成实测:RTX 5090 耗时不到 5 分钟 — gabxav · 2026-08-11
- 开源 LLM 语义缓存代理:最高降本 80%,响应低于 1 毫秒 — tom_doerr · 2026-08-11
- 英伟达削减单芯 HBM 用量,分析师指其为应对供应危机的权宜之计 — JOBhakdi · 2026-08-11