Qwen3-8 2.4T在NVIDIA GB300 NVL72上达288k tokens/s

RhubarbSimilar1683 · reddit · 2026-08-17

NVIDIA官方博客宣布,Qwen3-8 2.4T模型在NVIDIA GB300 NVL72上实现了每GPU每秒超过4K tokens的吞吐量,每用户每秒超过350 tokens(FP8精度)。该性能为Day 0表现,未来通过NVFP4等优化预计进一步提升。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →