Qwen3.6-27B-FP8单卡RTX 6000 Ada推理基准

Temporary-Owl1725 · reddit · 2026-07-06

在单张RTX 6000 Ada(48GB)上用vLLM 0.19部署Qwen3.6-27B-FP8的基准测试。基于ShareGPT样本、并发8-16下,测得TTFT p50约0.48秒、TPOT p50约29.2毫秒/词、峰值吞吐668.5 tok/s,KV缓存最大占用约32.7%。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →