Virginia Tech 新注意力机制让循环 LLM 单卡吞吐提升至 8.8 倍
rohanpaul_ai · x · 2026-10-07
Virginia Tech 论文《Hybrid Latent Attention for Looped Language Models》提出混合潜注意力(HLA),解决循环 LLM 的 KV cache 膨胀问题:
- 问题:循环模型把同一 token 反复过相同层,每一遍都往 KV cache 里追加,导致单卡能容纳的并发请求数大减。
- 方法:保留最近 128 个 token 的精确 KV,更早的 token 被压缩成紧凑向量,各次循环直接读取、无需重建。
- 效果:在 Ouro 模型上,16K 上下文时吞吐提升至 7.4 倍,整体可容纳请求数达 4.0–8.8 倍;数学、知识与推理任务精度保持在原模型 97% 以上。
- 额外优势:上下文越长收益越大;可对已有循环模型 checkpoint 增量训练新模块直接改造,无需重训全模型。
论文:arxiv.org/abs/2610.07940
「Infra」频道最新
- 欧洲 AI 短板不止模型:算力基建跟不上数月一代的迭代节奏 — ingliguori · 2026-10-07
- Chrome 155 正式支持 JPEG XL:压缩率比 JPEG 高 30-50% — jedisct1 · 2026-10-07
- 双 7900XTX 跑 27B 模型:等 LPDDR6 新平台还是上 WRX80 — MikeSouto · 2026-10-07
- POC 2026 议题:通过 NVIDIA GPU 驱动逃逸只读容器 — evilsocket · 2026-10-07
- 谷歌发布 SAM:让分散各机的 AI Agent 互发现、互调用工具 — thisguyknowsai · 2026-10-07
- 美光 NVHBM:带宽提升 30%,HBM 功耗降 15% — Ok_Warning2146 · 2026-10-07