同模不同后端,首token慢8倍
TypicalOcelot9 · reddit · 2026-07-17
这条帖子对比了同一个开权重模型在两个 OpenAI-compatible 后端上的真实体验,结论是:同样的接口形状,不代表同样的推理行为。
作者测到,专用推理主机在缓存失效场景下的表现明显更好:TTFT 约 1.2s、吞吐约 77 tok/s,并且确实是逐步流式返回;而某大型云厂商的托管端点虽然宣称支持 stream:true,但实际上会先把整段回复生成完,约 10s 后一次性吐出,等于对 agent 循环造成了实打实的停顿。
作者进一步排查了网络距离和自家代理,确认问题出在服务端缓冲。更关键的是:在真实的缓存命中形态下,那个被缓存失效放大的 10s 问题会明显缓解,TTFT 从 10s 降到 2.7s,也基本不再缓冲。帖子最后总结了三个基准测试原则:
- OpenAI-compatible 只说明请求格式,不说明行为质量
- stream:true 可能只是“表面流式”,要检查是否真的增量输出
- 必须按真实缓存分布测,而不是只看 cache-busted 的最坏情况
「Infra」频道最新
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11
- 本地跑 LLM 选卡:4 张 CMP-170HX 涨价 vs Mac Studio M5 — rumboll · 2026-09-11
- llama.cpp 为 RDNA4 调优 Flash Attention,大上下文提升明显 — pmttyji · 2026-09-11