RTX PRO 6000 跑 30B 模型达 2900 tok/s,端侧推理性能实测
HankYeomans · x · 2026-08-13
开发者分享了使用 NVIDIA RTX PRO 6000 显卡进行本地推理的性能实测数据。
- 模型与量化:运行 Nemotron-3.5-Lightning-30B-A3B-NVFP4 模型。
- 性能表现:实现了约 2900 tok/s 的聚合吞吐量,并成功分配了 8.1M 的 KV cache。
- 硬件评价:作者认为该显卡虽然价格昂贵,但物有所值。
所属事件:RTX PRO 6000 端侧推理实测跑 30B 模型达 2900 tok/s(2 条相关)→
「Infra」频道最新
- 六位数奖金加持,三星SK海力士工程师成韩国婚恋顶流 — HanchungLee · 2026-08-13
- 推理优化成关键:KV Cache 预计将占 35% 市场份额 — firstadopter · 2026-08-13
- 微软 2027 年自由现金流预计领跑,谷歌 Meta AI 算力投入仍为负 — Beth_Kindig · 2026-08-13
- 打破AI算力过剩传言:数据显示GPU需求依然远超供给 — bigdata · 2026-08-13
- 64GB Mac 跑 DeepSeek V4 Flash:修补 llama.cpp 后解码达 8 tok/s — memeka · 2026-08-13
- Netflix 采用 Kueue 替代内部系统,加码 Kubernetes 批处理 — rseroter · 2026-08-13