Context-Matched Distillation: Teacher Causality for Autoregressive Video Distillation
Hmrishav Bandyopadhyay, Xuanchi Ren, Zijian Huang, Jay Zhangjie Wu, Tianshi Cao, Ruilong Li, Bryan Chu, Sanja Fidler, Yi-Zhe Song, Zian Wang
cs.CV
2026-08-13
CMD 把少步蒸馏的 teacher 也改成因果的,打分时禁止访问未来帧与未来相机控制;相机旋转误差降至 1.27(Hard),VBench-I2V 总分 88.46 领先各自回归基线,相机运动分近乎翻倍。
自回归视频模型逐块生成,天然适合流式和交互,但每步去噪代价高,所以业界用少步蒸馏(DMD 类方法)把多步生成压成几步。问题出在监督信号上:DMD 需要一个 teacher 给 student 的生成结果打分,而现有管线(CausVid、Self-Forcing 一族)用的是双向注意力的 teacher,给整段完整 clip 打分。这样第 t 帧的分数可能依赖 t 之后的帧和控制信号,可在线生成时 student 根本看不到未来。论文称之为 teacher-student context mismatch:老师在用学生没有的信息批改学生。相机控制场景受害最深,teacher 拿到完整相机轨迹,student 却要在线执行每一步位姿更新,未来相机变化会漏进当前帧的监督;长视频同理,把局部 clip 当独立样本打分,丢掉了生成它的 rollout 上下文。
CMD(Context-Matched Distillation)分三步:
相机条件用帧间相对位姿增量渲染成 ray map,teacher 对第 t 帧只准看 t 及之前的控制。新加一种控制信号时,不需要再分别适配双向条件 teacher 和因果 student。
底座是 Cosmos-Predict2.5-2B:
| 基准 | 指标 | 最好基线 | CMD |
| VBench-I2V 短视频 | Total | 87.63(Causal Forcing) | 88.47(chunk4) |
| VBench-I2V | Camera Motion | 42.54(LingBot-World) | 76.12(chunk4) |
| SANA-WM 长视频(501 帧/约 30 秒) | Total | 80.72(Context Forcing) | 81.39(chunk1) |
| SANA-WM 长视频 | Dynamic Degree | 51.25 | 77.50(chunk4) |
| SANA-WM 相机控制 Simple | 旋转误差↓ | 1.2104(SANA-WM) | 0.8601(chunk4) |
| SANA-WM 相机控制 Hard | 旋转误差↓ | 2.0453(SANA-WM) | 1.2718(chunk4) |
消融里信息量最大的一行:同一框架下把因果 teacher 换回双向 teacher,短视频 Total 从 88.33 掉到 82.65,大部分增益来自因果对齐本身。主观侧用 Gemini 3.1 Pro 做盲测两两对比,chunk-4 模型对六个基线胜率 64%88%。
少步自回归视频生成是交互式世界模型实时化的必经之路,这篇把「teacher 不能作弊看未来」从直觉变成了便宜且可复制的实现:因果 teacher 训一次还能顺便初始化 student,长视频蒸馏靠同一套有界前缀直接扩展,不用加宽 teacher 的注意力窗口。相机消融最能说明问题的性质:同样用 ray map,双向 teacher 下 Simple split 旋转误差 5.73,换成完整 CMD 只有 1.37。很多时候 student 不听话,其实是被看得到未来的 teacher 教坏的。
长视频上外观一致性(SC/BC)低于 Rolling Forcing 等基线(88.59 对 96.09),动态幅度与一致性像是做了交换,动态强不等于画面稳。相机消融里 Base CMD(无 Prefix Scoring)在 Hard split 的旋转误差 2.16 反而低于完整版的 2.56,Prefix Scoring 的贡献在该设置不单调。主观看感依赖单一 LLM judge(Gemini 3.1 Pro),层级裁判规则也是作者自己定的。论文没有给出推理延迟与帧率数字,少步到底快到什么程度无法从文中核对。底座只有 2B,更大模型上是否同样受益未验证。