Qwen3.8-27B-FP8在GH200上实现10路并发流式推理,首包延迟10ms
MaziyarPanahi · x · 2026-08-15
Lambda 用户 MaziyarPanahi 实测:Qwen3.8-27B-FP8 模型在单块 NVIDIA GH200 上,通过 vLLM 同时处理 10 个真实请求,流式输出,每个请求最大输出 16K tokens,上下文长度 262K。首个流式事件在 10ms 内到达,所有请求均正常完成。
「Infra」频道最新
- 得州收紧AI数据中心审批:要求审计电力、水与社区影响 — rohanpaul_ai · 2026-08-15
- 8GB 显存跑 Qwen3.8-27B 仅 5 token/s,如何到可用速度 — SoAp9035 · 2026-08-15
- Harvey 训练垂直模型:Review Table 成本大幅降低 — ypatil125 · 2026-08-15
- TrendForce 上调 AI 加速器出货预测至增长 31% — Beth_Kindig · 2026-08-15
- NInfer 推理引擎 Day-0 支持 Qwen3.8-27B,RTX 5090 上生成速度达 200 tok/s — FormOne2615 · 2026-08-15
- Orion-16B突破100B训练token,采用去中心化算力 — const_reborn · 2026-08-15