Qwen3.6-27B-FP8单卡RTX 6000 Ada推理基准
Temporary-Owl1725 · reddit · 2026-07-06
在单张RTX 6000 Ada(48GB)上用vLLM 0.19部署Qwen3.6-27B-FP8的基准测试。基于ShareGPT样本、并发8-16下,测得TTFT p50约0.48秒、TPOT p50约29.2毫秒/词、峰值吞吐668.5 tok/s,KV缓存最大占用约32.7%。
「Infra」频道最新
- Nvidia 与 OpenAI 2500 亿美元担保新闻的重复转述 — rohanpaul_ai · 2026-07-27
- Nvidia 讨论为 OpenAI 10GW 俄亥俄园区提供 2500 亿美元担保 — rohanpaul_ai · 2026-07-27
- NVIDIA 等多家公司联署公开信,力挺开放前沿模型 — ying11231 · 2026-07-27
- AI 记忆芯片热潮下,CXMT 上市首日涨近 500% — Polymarket · 2026-07-27
- 游戏本跑图太慢?本地与云端图像生成算力成本探讨 — Simple-Evidence-9125 · 2026-07-27
- 有人估算闭源模型每兆字节权重要烧 1 万美元算力 — JosephJacks_ · 2026-07-27