RTX PRO 6000 显卡跑 30B 模型达 2900 tok/s
HankYeomans · x · 2026-08-13
网友分享使用 NVIDIA RTX PRO 6000 显卡的实测数据。在运行 Nemotron-3.5-Lightning-30B-A3B-NVFP4 模型时,该显卡实现了 2900 tok/s 的聚合吞吐量,并稳定分配了 8.1M 的 KV cache。作者评价该显卡虽然昂贵,但物有所值。
所属事件:RTX PRO 6000 端侧推理实测跑 30B 模型达 2900 tok/s(2 条相关)→
「Infra」频道最新
- 英伟达高管暗示计算范式巨变:稀疏性与物理基底共进化 — NaveenGRao · 2026-08-14
- 稀疏化不仅省算力还涨点:Un-0模型消除98%连接并提升性能 — NaveenGRao · 2026-08-14
- 单台 DGX Spark 实测:124B 模型连续输出 1.5 万 token — AcanthisittaOk1699 · 2026-08-14
- PyTorch 携手 AMD 优化 FP8 训练:吞吐量提升超 13% — PyTorch · 2026-08-14
- Red Hat 新推测解码器让 Kimi-K3 吞吐量提升 3.5 倍 — teortaxesTex · 2026-08-14
- AMD 拟发债融资 50 亿美元加码 AI 战 — ns123abc · 2026-08-14