推理性能别只报总吞吐,应拆成三项指标
isidentical · x · 2026-07-29
帖子主张,推理性能应该拆成三个指标来报:Prefill 输入吞吐、Decode 输出吞吐,以及 KV cache 占用,并且都要注明对应的上下文长度。
作者认为只报一个总的 tokens/s/GPU 会因为场景差异太大而失去可比性,更像营销数字,而不是可用于横向对照的基准。
「Infra」频道最新
- 印度 AI 推理市场将奖励模型与硬件协同优化的公司 — santoshpanda · 2026-07-29
- Hermes Agent 桌面版靠并行工具和远程本地模型圈粉 — Teknium · 2026-07-29
- 中文威胁行动者换服务器,并从 AI 转售站泄露 775 个密钥ID — cyb3rops · 2026-07-29
- 6家Nvidia系neocloud正洽谈印度数据中心租赁 — HimanshiET · 2026-07-29
- CXMT 被拿来对标 SK 海力士,芯片市值赛道升温 — basedjensen · 2026-07-29
- 一份推理工程清单覆盖 vLLM、量化到压测 — ZeYanjie · 2026-07-29