新方法宣称每 token KV 缓存体积再降 4 倍
zephyr_z9 · x · 2026-09-10
爆料称出现新的 KV 缓存压缩技术,宣称可让每 token 的 KV 缓存体积再缩小 4 倍,是推理内存优化的又一进展。原帖未附论文或技术细节,具体实现与验证情况待确认。
「Infra」频道最新
- DeepSeek 九个月将每 token KV 缓存体积压缩 54 倍 — zephyr_z9 · 2026-09-10
- vLLM 完整支持 DeepSeek-V4.1-Flash 新架构,含投机解码与 PD 分离 — vllm_project · 2026-09-10
- 评论者称其推理架构复杂到基础设施商难以复制,建议自建可抽成 10-20% — zephyr_z9 · 2026-09-10
- A19 Pro 四核算力 140 TOPS,A20 Pro 端侧推理或超 140 TFlops — AIFlow_ML · 2026-09-10
- KV 缓存比 V1 小 437 倍:V4.1 Flash 直击中国算力内存瓶颈 — ChrisGPT · 2026-09-10
- Aspen 研讨会探讨「公共算力」:数据中心如何服务社区而非对抗社区 — lfschiavo · 2026-09-10