阶跃联创朱亦波提出 KITE:把 PD 分离思路引入训练,扩展 Agentic LLM

teortaxesTex · x · 2026-09-29

Step 5 Preview 发布后,阶跃星辰联合创始人朱亦波在知乎发布技术长文,探讨团队能否把推理侧的「PD 分离」思想推广到训练侧,并提出 KITE(KV-Invariant Transformer Expansion)方案。

核心问题是同时优化三件事:模型质量、训练成本与推理成本。MoE 是经典的「三赢」案例,但 Upcycling、YOCO 等路线往往顾此失彼——为了补回模型质量而扩大规模时,会推高训练或推理成本。

KITE 将 scaling 与 upcycling 结合,同时保持 KV 计算不变:先训练一个更小的 prefiller 来生成 KV cache,再在不变 KV 的前提下扩展模型,为 agentic LLM 的规模化提供一条潜在新路径。原文为作者一手技术深潜。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →