无需训练:几何 KV 路由让 Qwen 长上下文显存减半

Electrical_Offer5667 · reddit · 2026-08-22

作者提出了一种无需重新训练的几何 KV 路由方法,应用于冻结的 Qwen 模型。核心机制是将过期的 KV 条目分配到由质心表示的几何区域,解码时仅对 {sink + 近期窗口 + 选中区域} 进行注意力计算。在 Qwen3.5-2B (32k 上下文) 和 Qwen3-4B (8k 上下文) 的测试中,该方法能在保持检索能力的前提下,物理 KV 读取量减少约 3.7x 至 31x。虽然目前由于 GPU 算力优势和路由开销,在短上下文下的墙钟速度未超越优化后的密集注意力,但展示了在长上下文场景下减少显存带宽和容量压力的潜力。作者提供了 GitHub Demo 供测试。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →