无需训练:几何 KV 路由让 Qwen 长上下文显存减半
Electrical_Offer5667 · reddit · 2026-08-22
作者提出了一种无需重新训练的几何 KV 路由方法,应用于冻结的 Qwen 模型。核心机制是将过期的 KV 条目分配到由质心表示的几何区域,解码时仅对 {sink + 近期窗口 + 选中区域} 进行注意力计算。在 Qwen3.5-2B (32k 上下文) 和 Qwen3-4B (8k 上下文) 的测试中,该方法能在保持检索能力的前提下,物理 KV 读取量减少约 3.7x 至 31x。虽然目前由于 GPU 算力优势和路由开销,在短上下文下的墙钟速度未超越优化后的密集注意力,但展示了在长上下文场景下减少显存带宽和容量压力的潜力。作者提供了 GitHub Demo 供测试。
「Infra」频道最新
- 苹果或推 1TB+ 统一内存芯片,影响分布式训练 — benfielding · 2026-08-22
- AI 价值转向互连:HBM 密度见顶下的半导体投资逻辑 — BenBajarin · 2026-08-22
- DSPy 3.3.1 发布:强化 Python 隔离与 MCP 2.0 支持 — dbreunig · 2026-08-22
- 硅谷误解了民众反对数据中心的真实原因 — jachiam0 · 2026-08-22
- Anthropic 招募 OpenAI 前硬件团队成员,加速自研芯片 — eliebakouch · 2026-08-22
- Modal 推出 Training Gym,简化 RL 后训练基础设施配置 — andersonbcdefg · 2026-08-22