Qwen3-8 2.4T在NVIDIA GB300 NVL72上达288k tokens/s
RhubarbSimilar1683 · reddit · 2026-08-17
NVIDIA官方博客宣布,Qwen3-8 2.4T模型在NVIDIA GB300 NVL72上实现了每GPU每秒超过4K tokens的吞吐量,每用户每秒超过350 tokens(FP8精度)。该性能为Day 0表现,未来通过NVFP4等优化预计进一步提升。
「Infra」频道最新
- antirez 的 DwarfStar:专家冷热分层,单机跑 DeepSeek V4 达 45 t/s — antirez · 2026-08-17
- DeepSeek v4 PRO Q2 实测:VRAM/RAM 混合推理达 45 t/s — antirez · 2026-08-17
- 模型路由应优化在 harness 层而非网关层 — agihouse_org · 2026-08-17
- Qwen3.8-27B 多卡与 RPC 推理实测:RX 7900 GRE 显存不足 — tabletuser_blogspot · 2026-08-17
- AI支出差距625倍:头部1%公司人均月花7500美元,中位数仅12美元 — rohanpaul_ai · 2026-08-17
- TrendForce:AWS 2026年将部署英伟达GB300为主力GPU,同时扩大Trainium出货 — Beth_Kindig · 2026-08-17