本地模型 Prefill 速度被忽视:API 输入处理到底快多少没人测

BobtheGodGamer · reddit · 2026-09-19

作者提出一个常被忽略的问题:大家在对比本地跑大模型(如 Spark、Strix Halo 这类设备)与 API(Opus、Astra 等)时,几乎只看 decode(生成)速度,却忽略了 prefill(输入处理)速度——如果本地 prefill 很慢,长上下文场景整体体验会差很多,但很少有人讨论这一差距。

他询问是否有公开 benchmark 或数据对比各家 API 的输入处理速度与本地硬件的 prefill 性能。帖子本身是提问,但点出了本地推理评测的一个盲区。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →