R1推理速度达150 tps,是DeepSeek的7倍

teortaxesTex · x · 2026-08-16

推文讨论推理性能:R1在Rubin上以约150 tps运行,比DeepSeek官方快7倍,达到峰值吞吐的60%,接近1 t/s/watt。还提到200k是纯推理的下限,若将Flash(约GLM 5.2级别)限制在75 tps,每个NPU可支持约200个agent,一个SuperPoD可支持160万agent。此外,强调完美细粒度可重放性可提供大量训练信号,相当于无限数据机器。

所属事件:GLM 更新节奏与 DeepSeek 算力、推理性能引热议(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →