QuantWM:免训练 2-bit KV cache 量化,视频世界模型压缩 6.2 倍

NationalUniversityofSingapore · hf · 2026-10-06

现有 2-bit KV cache 量化在 VBench 上近乎无损,但用于视频世界模型会导致严重时序闪烁。作者发现 Key 的量化重建误差虽小于 Value,输出退化却更大——Key 扰动会改变 attention logits 并挪动 Query 选中的时空 token。

据此提出免训练的 QuantWM 框架:

在 LingBot-World-v2、HY-World 1.5、Matrix-Game-2、Longcat-Video、Causal-Forcing 上显著改善视觉质量与时序一致性,KV cache 最高压缩 6.20 倍,额外开销很小。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →