NVIDIA 收录 TriAttention,用三角函数压缩 KV 缓存

青稞AI · wechat · 2026-08-20

针对长推理中 KV Cache 占用显存过高的问题,NVIDIA 研究科学家提出 TriAttention 方法。该方法基于一个发现:pre-RoPE 空间中的 Q/K 向量高度集中于固定中心,几乎不随内容与位置变化。利用这一特性,该方法通过三角级数直接估算 Key 的重要性分数,进而对 KV Cache 进行剪枝。该方法已被 NVIDIA TensorRT-LLM 官方仓库收录,并被集成到实时长视频生成框架 LongLive 中,在局部注意力窗口内削减了 50% 的显存且无损质量。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →