Qwen3.8-27B 在单张 GH200 上跑出 129.8 tok/s
MaziyarPanahi · x · 2026-08-21
Qwen3.8-27B (BF16) 模型在单张 NVIDIA GH200 上实现了 129.8 tokens/s 的推理速度。测试采用 vLLM 框架配合 DFlash2 技术栈:在单流请求场景下,该组合比普通自回归推理快 2.18 倍,比 MTP-3 快 9.4%。
所属事件:Qwen3.8-27B 单张 GH200 跑出 129.8 tok/s(3 条相关)→
「Infra」频道最新
- DecagonAI 将实时 TTS 首音频延迟降至 30ms — dhruv2038 · 2026-08-21
- 预测市场显示 70% 概率州政府将禁数据中心 — Polymarket · 2026-08-21
- 美工会警告:新英格兰数据中心禁令或致数千人失业 — Polymarket · 2026-08-21
- Waymo 硬件成本降至 2 万美元,特斯拉欲将 Cybercab 总成本压低 — JOBhakdi · 2026-08-21
- Cursor 揭秘 Git 存储新架构:S3 即真源,本地仅缓存 — xennygrimmato_ · 2026-08-21
- Unsloth Desktop 更新:实验性自动压缩与局域网远程访问 — danielhanchen · 2026-08-21