TurboQuant-GPU:大模型 KV 缓存压缩 5 倍,支持任意英伟达 GPU

tom_doerr · x · 2026-08-12

开源项目 TurboQuant-GPU 能够将大语言模型(LLM)推理时的 KV cache 压缩 5.02 倍,适用于任意 NVIDIA GPU。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →