R1推理速度达150 tps,是DeepSeek的7倍
teortaxesTex · x · 2026-08-16
推文讨论推理性能:R1在Rubin上以约150 tps运行,比DeepSeek官方快7倍,达到峰值吞吐的60%,接近1 t/s/watt。还提到200k是纯推理的下限,若将Flash(约GLM 5.2级别)限制在75 tps,每个NPU可支持约200个agent,一个SuperPoD可支持160万agent。此外,强调完美细粒度可重放性可提供大量训练信号,相当于无限数据机器。
所属事件:GLM 更新节奏与 DeepSeek 算力、推理性能引热议(3 条相关)→
「Infra」频道最新
- 高性能计算新书:《现代硬件算法》开源编写中 — thehiphopswami · 2026-08-16
- Q8_0 与 UD-Q6_K_XL 量化质量差异有多大 — AnimalPuzzleheaded71 · 2026-08-16
- Gavin Baker:英伟达正成为 AI 界的中央银行 — VibeMarketer_ · 2026-08-16
- 万亿参数LLM的本质:数十亿MOSFET开关在3GHz翻转 — blaizedsouza · 2026-08-16
- AI下一个瓶颈是电力,算力并非唯一制约 — ingliguori · 2026-08-16
- 1bit量化让Qwen 27B在12GB显存跑出92 tokens/s — zyxciss · 2026-08-16