TurboQuant-GPU:大模型 KV 缓存压缩 5 倍,支持任意英伟达 GPU
tom_doerr · x · 2026-08-12
开源项目 TurboQuant-GPU 能够将大语言模型(LLM)推理时的 KV cache 压缩 5.02 倍,适用于任意 NVIDIA GPU。
- 核心机制:通过随机正交旋转使 KV cache 坐标近似高斯分布,随后应用 Lloyd-Max 量化,以每元素 3 bit 的体积保持 0.98 的余弦相似度。
- 技术栈:基于 cuTile 内核开发,并提供自动的 PyTorch 回退机制,可通过 pip 直接安装。
「Infra」频道最新
- 瑞银预测 2030 年 KV 缓存达 1 ZB,Rubin 标配缩水至 8.3TB — zephyr_z9 · 2026-08-12
- OpenSSH 10.5 发布:AI 成漏洞挖掘主力,加速版本迭代 — jedisct1 · 2026-08-12
- 开源工具 hmon:C++ 编写的实时系统监控,支持 GPU 与 Docker — tom_doerr · 2026-08-12
- A100未退役真相:老旧算力靠吃掉数据中心废弃电力续命 — BenBajarin · 2026-08-12
- Anthropic 招聘三国算力负责人,将管理超 500 亿美元基础设施 — surmenok · 2026-08-12
- Grace Blackwell 系统投资回报率高达 260% — BenBajarin · 2026-08-12