QuantWM:免训练 2-bit KV cache 量化,视频世界模型压缩 6.2 倍
NationalUniversityofSingapore · hf · 2026-10-06
现有 2-bit KV cache 量化在 VBench 上近乎无损,但用于视频世界模型会导致严重时序闪烁。作者发现 Key 的量化重建误差虽小于 Value,输出退化却更大——Key 扰动会改变 attention logits 并挪动 Query 选中的时空 token。
据此提出免训练的 QuantWM 框架:
- 量化敏感感知聚类(QSAC):结合历史 Query 敏感度与残差范围选取 INT2 友好的 Key 质心
- 主子空间注意力补偿(PSAC):用低秩投影沿 Query 主子空间修正剩余 Key 误差,稳定 attention logits
在 LingBot-World-v2、HY-World 1.5、Matrix-Game-2、Longcat-Video、Causal-Forcing 上显著改善视觉质量与时序一致性,KV cache 最高压缩 6.20 倍,额外开销很小。
「研究」频道最新
- Kyutai 用何恺明团队 Drifting 方法训练 100M 端侧 TTS,WER 低于 1% — serrjoa · 2026-10-06
- 谷歌SHIFT按查询自动构建多智能体系统,准确率领先最强基线7.2点 — google · 2026-10-06
- 新研究诊断LLM数学短板:发现能力是最大瓶颈,可定向修复 — TexasAMUniversity · 2026-10-06
- RealtimeWAM:一步生成+异步推理,机器人动作模型提速25倍 — NanyangTechnologicalUniversity · 2026-10-06
- OmniConfess免训练缓解全模态幻觉,附3,540例新基准 — Huiqiang Rong · 2026-10-06
- ADSD框架让AI自诊数值求解器,误差降低近71倍 — Peter Chen · 2026-10-06