TriAttention 集成至 TensorRT-LLM,优化长文本推理显存

songhan_mit · x · 2026-08-05

TriAttention KV 缓存压缩方法已正式集成至 NVIDIA TensorRT-LLM 中。这是一种无需额外训练、在解码阶段运行的缓存驱逐机制,专为长上下文 LLM 推理设计。

该方法通过离线校准获取注意力头的统计信息,在生成时利用三角函数计算 token 的重要性评分。它会保留最重要的 token 并物理压缩缓存,从而显著降低显存占用,允许 GPU 同时处理更多序列,提升整体推理效率。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →