智能卸载活跃请求 KV cache,线性注意力内存优势不再
samsja19 · x · 2026-09-09
samsja19 指出一种新的 KV cache 卸载思路与 CPU 端 KV cache 卸载(如 Mooncake)的本质区别:
- Mooncake 式卸载针对的是 agentic rollout 产生的非活跃请求的缓存;而新方法可以卸载活跃请求。
- 内存占用一直是线性注意力(linear attention)相对注意力的核心优势论据;随着智能卸载方案出现,这一优势「不再成立」。
「Infra」频道最新
- Proteus 为 Qwen3 122B 定制 GPU 内核,比 vLLM 最快实现快 5.2 倍 — matei_zaharia · 2026-09-09
- Google Cloud 八月 AI 基础设施盘点:gVisor 进 Ray 集群、Filestore 上 Colossus — dl_weekly · 2026-09-09
- 可证明隐私的远程推理服务兴起:密码学保证提示词对服务商不可读 — corbtt · 2026-09-09
- 3000亿输出token耗资数千万美元,Ethan Mollick:算力再多也不够用 — eldonredwards · 2026-09-09
- 传 Google 或取代 Nvidia 成台积电最大客户,年初传闻正逐渐应验 — zephyr_z9 · 2026-09-09
- Tahuna 开源:一条命令在远程 GPU 上跑 ML 训练全流程 — Monaim101 · 2026-09-09