TriAttention 集成至 TensorRT-LLM,优化长文本推理显存
songhan_mit · x · 2026-08-05
TriAttention KV 缓存压缩方法已正式集成至 NVIDIA TensorRT-LLM 中。这是一种无需额外训练、在解码阶段运行的缓存驱逐机制,专为长上下文 LLM 推理设计。
该方法通过离线校准获取注意力头的统计信息,在生成时利用三角函数计算 token 的重要性评分。它会保留最重要的 token 并物理压缩缓存,从而显著降低显存占用,允许 GPU 同时处理更多序列,提升整体推理效率。
「Infra」频道最新
- Astera Labs 预测:NPO 将于 2027 年部署,CPO 随后在 2028 年落地 — bookwormengr · 2026-08-05
- 美国芯片出口管制适得其反,反倒助推中国设备厂崛起 — kevinsxu · 2026-08-05
- 单季AI投入超千亿,SpaceX财报后股价一夜蒸发八千亿 — 智东西 · 2026-08-05
- 前 OpenAI 高管驳高盛预测:推理成本将暴降百倍,token 是极差计量单位 — ChrSzegedy · 2026-08-05
- SK海力士与三星评估在华工厂引入中微刻蚀机 — zephyr_z9 · 2026-08-05
- 英伟达开源 CuTe 代数与编译栈,加速 AI 智能体编写底层算子 — GregoryDiamos · 2026-08-05