DiffusionGemma 实测单卡 97 tok/s,vLLM 补丁数日内合入
GlennCameronjr · x · 2026-09-23
开发者 mmastrac 分享了 DiffusionGemma 的推理实验结果:并发为 1 时达到 97 tok/s,并发 32 时达到 317 tok/s——而这仅用了一块 Spark 设备。作者感叹这种扩散式语言模型的速度长期被忽视,vLLM 的相关补丁将在接下来几天内合入。
这意味着扩散式解码思路可能在小设备端侧推理上有实际价值,配合 vLLM 支持后值得持续关注。
「Infra」频道最新
- AMD 放出 Helios 机架幕后视频,首集今天上线 — wkmyrhang · 2026-09-24
- NVIDIA 送 Unsloth 一台 DGX Station,团队透露量化与 RL 优化方向 — danielhanchen · 2026-09-24
- Baseten 上线 Nemotron 3 Diarization:单卡支持 500 路实时分离流 — baseten · 2026-09-24
- Unsloth 累计下载破 5 亿,Qwen3.8-27B GGUF 成其最热模型 — danielhanchen · 2026-09-23
- MLSys 2027 开放投稿,Song Han 出任程序委员会联合主席 — songhan_mit · 2026-09-23
- Agentic AI 的存储冲击:数据层成企业部署新瓶颈 — BenBajarin · 2026-09-23