Kimi K3 的 tokenizer 优化把首 token 延迟降了约 325 毫秒

philipkiely · x · 2026-07-28

一位推理工程师说,他过去一直把 tokenization 时间视为可以忽略,但在 10 万到 100 万 token 的输入、且大部分前缀命中缓存的场景里,这个前置开销会明显影响 TTFT(time to first token)。

引用中的文章讲的是对 Kimi K3 的一次优化;配图显示,tokenization 约从 400ms 降到 20ms,TTFT 也从约 1050ms 降到 670ms,整体节省约 325ms,首 token 延迟提升约 20–35%。

这类案例说明:在长上下文、agentic 工作负载里,瓶颈可能不再是模型本身,而是 prefill / tokenizer 这条链路。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →