单节点 B300 跑 2.8T 模型,K3 解码吞吐量达 947 tokens/s
casper_hansen_ · x · 2026-08-03
Casper Hansen 分享了 K3 模型(参数量达 2.8T)在单个 B300 节点上的解码速度实测数据。
- 整体吞吐量:在 batch size 为 32 时,解码吞吐量达到 947 tokens/s。
- 单用户体验:在单用户并发下,生成速度可达 152 tokens/s。
对于运行在单节点上的万亿参数级别模型而言,这一推理速度表现相当出色。
「Infra」频道最新
- Minimax H3 实测:8GB 显存本地跑视频生成 — inuptia · 2026-08-04
- 算力稀缺反而激发创新?AI研究圈激辩新实验室竞争力 — reneeshah123 · 2026-08-04
- AI 智能体自我迭代优化 vLLM,DeepSeek 等模型吞吐量提升 16% — yisongyue · 2026-08-04
- 黄仁勋宣布英伟达与韩国KAIST建联合AI实验室 — hyunw_kim · 2026-08-04
- 24GB 显存跑起前沿大模型,本地部署正冲击云端 — mintybadgerme · 2026-08-04
- 自建 AI 编程环境:如何隔离环境并编排多模型协同工作 — Illhoon · 2026-08-04