NVIDIA 收录 TriAttention,用三角函数压缩 KV 缓存
青稞AI · wechat · 2026-08-20
针对长推理中 KV Cache 占用显存过高的问题,NVIDIA 研究科学家提出 TriAttention 方法。该方法基于一个发现:pre-RoPE 空间中的 Q/K 向量高度集中于固定中心,几乎不随内容与位置变化。利用这一特性,该方法通过三角级数直接估算 Key 的重要性分数,进而对 KV Cache 进行剪枝。该方法已被 NVIDIA TensorRT-LLM 官方仓库收录,并被集成到实时长视频生成框架 LongLive 中,在局部注意力窗口内削减了 50% 的显存且无损质量。
「Infra」频道最新
- 民调:美民众反对本地数据中心比例飙升至 75% — Polymarket · 2026-08-21
- Ramp Router 宣布 GPT-5.6 Sol 推理价格减半 — KlausCodes · 2026-08-21
- NVIDIA 发布官方 CUDA MCP 服务器,辅助 GPU 代码编写与性能分析 — swagonflyyyy · 2026-08-21
- Escha 声称其 2bit 量化模型在 FP8 基准测试中表现持平 — luedtek · 2026-08-21
- 研究员吐槽:每年因会议被占用的算力资源惊人 — ChongZzZhang · 2026-08-21
- AT&T 将 40% 员工 AI 用量转至开源模型 — Hesamation · 2026-08-21