字节Seed研究:分块KV压缩引入相位敏感性,长上下文检索差达40点
ByteDance-Seed · hf · 2026-10-01
字节跳动 Seed 团队发布新研究,系统揭示分块 KV-cache 压缩(长上下文推理的常用省显存手段)带来的隐性问题:相位敏感性。
- 压缩将连续 token 窗口按固定步长折叠,由此引入新位置坐标:token 相对压缩窗口边界的「相位」。同一信息在不同相位下检索难度截然不同,呈周期性变化。
- 在采用此类压缩的大型开源权重模型上,长上下文检索准确率随相位不同可相差最多 40 个百分点,而平均分指标会掩盖这种系统性弱点。
- 团队从零预训练了多个采用不同 KV 压缩设计的 transformer,均复现该现象;通过因果干预的机制分析发现注意力组件对不同源相位存在不对称的「相位特化」,理想化检索模型的梯度流分析提示这可能是训练动力学的必然结果。
- 结论:评测带分块 KV 压缩的模型必须跨相位测量,只看平均准确率会掩盖周期性失败模式。
「Infra」频道最新
- Cerebras COO 清仓 7800 万美元股票,恰逢 OpenAI 弃用其芯片传闻 — TheZachMueller · 2026-10-01
- 日本医生个人三值化 Qwen27B,51.5GB 压到 7.3GB 仍可看图生提示词 — udmrzn · 2026-10-01
- 6500 美元租游戏 GPU 训出 8B 模型,手机 CPU 跑 60 tokens/s — markjeffrey · 2026-10-01
- 推测解码草稿何时被接受?研究者为贪婪解码等场景建理论 — baseten · 2026-10-01
- ComfyUI 推出 Comfy API:工作流 JSON 一键部署为可扩展推理端点 — PurzBeats · 2026-10-01
- NVIDIA VSS 3.3:一个提示词 30 分钟造出产线视觉 AI Agent — NVIDIAAI · 2026-10-01