从抽象表示直接推导 KV-cache 位置,prefill 与推理形式可互通
vtabbott_ · x · 2026-10-03
作者 vtabbott 分享了一个关于抽象表示的技术观察:可以直接推导出 KV-cache 应该放在哪里以得到推理形式,即 prefill 与推理之间存在可表达的关系。帖子附带一张图,右上角的符号用于在两种模式间切换,展示了同一抽象表示如何同时覆盖训练/预填充与推理两种形态。这属于对 Transformer 推理优化中 KV-cache 机制的形式化理解,说明好的抽象层能让推理优化从「手工技巧」变成「可推导结论」。
「Infra」频道最新
- 神秘买家豪掷数十亿求购 500MW 起步的带电算力用地 — JohnnyNi13 · 2026-10-03
- 双 RTX 3090 本地跑 256k 上下文模型,实战数月后求升级建议 — knighty1981 · 2026-10-03
- Prime Intellect 用 NVFP4 压缩 MLA KV 缓存,可多缓存约 50% token — TheZachMueller · 2026-10-03
- Runware 推出 Serverless GPU:空闲 $0,低至 $0.63/GPU 小时 — aziz4ai · 2026-10-03
- 布科夫:生成式AI只有卖GPU的在赚钱,重演互联网泡沫 — burkov · 2026-10-03
- 黄仁勋早已不止卖 GPU:NVIDIA 从 CUDA 一路铺到物理 AI — sudoraohacker · 2026-10-03