Kimi K3 的 tokenizer 优化把首 token 延迟降了约 325 毫秒
philipkiely · x · 2026-07-28
一位推理工程师说,他过去一直把 tokenization 时间视为可以忽略,但在 10 万到 100 万 token 的输入、且大部分前缀命中缓存的场景里,这个前置开销会明显影响 TTFT(time to first token)。
引用中的文章讲的是对 Kimi K3 的一次优化;配图显示,tokenization 约从 400ms 降到 20ms,TTFT 也从约 1050ms 降到 670ms,整体节省约 325ms,首 token 延迟提升约 20–35%。
这类案例说明:在长上下文、agentic 工作负载里,瓶颈可能不再是模型本身,而是 prefill / tokenizer 这条链路。
「编程与Agent」频道最新
- 微软研究院揭示 LLM 致命缺陷:多轮对话极易丢失用户意图 — alan_ritter · 2026-07-28
- 创业者沉迷大而全,AI 时代更需组件化突破 — zeeg · 2026-07-28
- OpenAI、Google、Replit 与 Perplexity 讨论 AI agents 如何改写软件工程 — steipete · 2026-07-28
- 开源 SongForge-MCP 让 Claude 本地生成整首歌 — RaVN3X · 2026-07-28
- Gemini CLI 通过内嵌 Seatbelt 配置修复 macOS 沙盒崩溃 — amelidev · 2026-07-28
- Millwright 开源:自托管 Rust LLM 路由器支持混合供应商 — teachmehowtowookiee · 2026-07-28