同模不同后端,首token慢8倍

TypicalOcelot9 · reddit · 2026-07-17

这条帖子对比了同一个开权重模型在两个 OpenAI-compatible 后端上的真实体验,结论是:同样的接口形状,不代表同样的推理行为。

作者测到,专用推理主机在缓存失效场景下的表现明显更好:TTFT 约 1.2s、吞吐约 77 tok/s,并且确实是逐步流式返回;而某大型云厂商的托管端点虽然宣称支持 stream:true,但实际上会先把整段回复生成完,约 10s 后一次性吐出,等于对 agent 循环造成了实打实的停顿。

作者进一步排查了网络距离和自家代理,确认问题出在服务端缓冲。更关键的是:在真实的缓存命中形态下,那个被缓存失效放大的 10s 问题会明显缓解,TTFT 从 10s 降到 2.7s,也基本不再缓冲。帖子最后总结了三个基准测试原则:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →