CtrlCache 免训练加速交互式视频世界模型,DiT 提速 1.21–1.41 倍
Shangye Song · hf · 2026-10-07
- 交互式视频世界模型逐 chunk 自回归生成,每 chunk 仍需多次昂贵去噪。现有免训练缓存策略只看模型内部去噪动态,忽略控制信号。
- 关键观察:交互生成中控制信号先于去噪到达,据此导出的调度零前向开销;结构相似度在动作切换处骤降,低频结构比高频细节更持久。
- CtrlCache 据此做动作感知调度:将 chunk 标为 initial/transition/turning/steady,initial 与 transition 保留完整计算,turning 与 steady 复用同 chunk 内最近完整计算步的 transformer 残差;并引入频率混合的历史先验引导,无需额外 DiT 前向。
- 在 Matrix-Game 2.0 和 LingBot-World v1/v2 上实现 1.21x–1.41x DiT 主干加速,且 WBench Overall 全部超越原推理。
「Infra」频道最新
- VEDA 稀疏注意力登陆 ComfyUI,MiniMax H3 生视频提速近一倍 — robomar_ai_art · 2026-10-07
- 同等预算怎么选:H200 vs 多卡 RTX PRO 6000 推理实战对比 — recentheartbroken · 2026-10-07
- Mistral 发布日:有用户实测 TPS 仅约 30,速度再度放缓 — bdsqlsz · 2026-10-07
- EmbeddingGemma 2 移植进浏览器:WebGPU 上跑图文检索照片搜索 — FinancialAd1961 · 2026-10-07
- 生产环境怎么应对 LLM 模型弃用?作者做了跨厂商追踪实验 — shamikhan005 · 2026-10-07
- 罕见美洲栗树林下月将被拆毁,为数据中心让路引争议 — Promptmethus · 2026-10-07