推理性能别只报总吞吐,应拆成三项指标

isidentical · x · 2026-07-29

帖子主张,推理性能应该拆成三个指标来报:Prefill 输入吞吐、Decode 输出吞吐,以及 KV cache 占用,并且都要注明对应的上下文长度。

作者认为只报一个总的 tokens/s/GPU 会因为场景差异太大而失去可比性,更像营销数字,而不是可用于横向对照的基准。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →