YOCO 架构拆解:模型后半段所有层共享同一份 KV 缓存
stochasticchasm · x · 2026-09-11
关于 YOCO(You Only Cache Once)架构,作者澄清其设计其实非常简单:
- 模型前半部分是普通结构;
- 将隐藏状态再投影一次得到 K/V,然后后半段所有层复用这同一份 KV 缓存,大幅减少缓存开销。
作者还提到相关讨论中正式提及了 YoCo,并纠正命名应为 YOCO 而非 YoCo。
所属事件:YOCO 架构拆解:后半段所有层共享一份 KV 缓存(4 条相关)→
「研究」频道最新
- 又一个模型转向 Muon:行业观察称其正成为训练默认优化器 — stochasticchasm · 2026-09-11
- SkillAdam:把 Adam 优化器思想搬进 Agent 技能文档自进化 — dair_ai · 2026-09-11
- 研究者称置信区间实际覆盖率仅 10-25%,远低于标称的 95% — RexDouglass · 2026-09-11
- Crucible:Mamba2+Z3 验证的神经符号开源架构,Kaggle T4 可训练 — JustRoccat · 2026-09-11
- p=0.05 的发现实际复现率仅 10-25%,研究者提醒勿信 95% 置信 — RexDouglass · 2026-09-11
- 前 Scale AI 高管传播「缓慢的规模法则之死」引热议 — rbhar90 · 2026-09-11