Virginia Tech 新注意力机制让循环 LLM 单卡吞吐提升至 8.8 倍

rohanpaul_ai · x · 2026-10-07

Virginia Tech 论文《Hybrid Latent Attention for Looped Language Models》提出混合潜注意力(HLA),解决循环 LLM 的 KV cache 膨胀问题:

论文:arxiv.org/abs/2610.07940

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →