KV cache 最易被误解的一点:token 可以先生成,后进缓存
techNmak · x · 2026-09-18
作者澄清了 decoder-only Transformer 中 KV cache 的一个常见误解:并非所有 token 以相同方式经过 LLM。
- Prefill 阶段:prompt (x1…x4) 一次性处理,每层自注意力算出各位置的 K/V 存入该层缓存;最后一个 prompt 位置的表示产生 y1 的 logits。
- 易错点:选出生成 y1 不代表 y1 已在 KV cache 里。下一步 y1 作为第 5 个位置进入模型,其 Q/K/V 逐层计算,query 只需 attend 缓存中位置 1-4 的 K/V 加上自己的 K/V,算完再把 K/V 追加进缓存。
- 依此循环:y2 作为位置 6 处理,缓存随新位置增长,past K/V 复用而非重算。
核心结论:一个 token 可以在它被处理进 KV cache 之前就已经生成——这个先后顺序差异对理解解码细节很重要。
「研究」频道最新
- 37075 个并行 agent 跑药物发现,模拟药企分工 6 小时筛完数千临床试验 — bravo_abad · 2026-09-18
- AMP 提出把机器人操控化为像素分类,绕开动作空间爆炸 — jiqizhixin · 2026-09-18
- PWNN 论文:神经网络变身「费电电路」远程注入故障窃取 AES 密钥 — chaumian · 2026-09-18
- 纯视觉自驾车挑战比利牛斯山路:从模块化架构聊起的实战回顾 — abursuc · 2026-09-18
- ACE-Data-0 上线首月下载近 12 万:1700 万帧多模态具身数据集 — liuziwei7 · 2026-09-18
- 李飞飞:5.4 亿年视觉演化驱动了智能的诞生 — rohanpaul_ai · 2026-09-18