Matthew Berman:不报 tokens/s 就说机器能跑哪个模型没有意义

MatthewBerman · x · 2026-10-12

Matthew Berman 发推指出,讨论某台机器「能跑哪个模型」时,如果不说推理速度(tokens per second),这句话没有任何意义。可运行与可用之间的差距全在吞吐率上——同一模型在不同硬件上每秒生成的 token 数可能相差数倍,直接决定体验。这是对近期大量本地部署/端侧跑模型宣传的常见缺口的吐槽。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →