阶跃联创朱亦波提出 KITE:把 PD 分离思路引入训练,扩展 Agentic LLM
teortaxesTex · x · 2026-09-29
Step 5 Preview 发布后,阶跃星辰联合创始人朱亦波在知乎发布技术长文,探讨团队能否把推理侧的「PD 分离」思想推广到训练侧,并提出 KITE(KV-Invariant Transformer Expansion)方案。
核心问题是同时优化三件事:模型质量、训练成本与推理成本。MoE 是经典的「三赢」案例,但 Upcycling、YOCO 等路线往往顾此失彼——为了补回模型质量而扩大规模时,会推高训练或推理成本。
KITE 将 scaling 与 upcycling 结合,同时保持 KV 计算不变:先训练一个更小的 prefiller 来生成 KV cache,再在不变 KV 的前提下扩展模型,为 agentic LLM 的规模化提供一条潜在新路径。原文为作者一手技术深潜。
「编程与Agent」频道最新
- 视频转写纠错思路:抽音抽帧+ASR+前沿模型结合画面修正 — capetorch · 2026-09-29
- bdsqlsz 近期用 vibe coding 训练 DLSS5 权重,为自研 3D 游戏做准备 — bdsqlsz · 2026-09-29
- 周末做出让 Agent「正确失败」的故障:记忆也可能学到错误教训 — Similar-Split7292 · 2026-09-29
- Jev mode 玩出新花样:让 llama.cpp 直接用图像当提示词做选择 — opUserZero · 2026-09-29
- 用 Codex 控制安卓机抓取小红书爆款数据,Build in Public 或选小红书 — huangyun_122 · 2026-09-29
- 用 Claude 与 DeepSeek 逆向重构游戏,三作合一还能玩 — ericcalyborn · 2026-09-29