Qwen3.8-27B-FP8在GH200上实现10路并发流式推理,首包延迟10ms

MaziyarPanahi · x · 2026-08-15

Lambda 用户 MaziyarPanahi 实测:Qwen3.8-27B-FP8 模型在单块 NVIDIA GH200 上,通过 vLLM 同时处理 10 个真实请求,流式输出,每个请求最大输出 16K tokens,上下文长度 262K。首个流式事件在 10ms 内到达,所有请求均正常完成。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →