ContextMaster 统一多镜头视频生成,单 GPU 达 16 FPS

KlingTeam · hf · 2026-08-07

ContextMaster 提出了一种名为交互式多镜头视频创作 (IMVC) 的全新设定,允许单一模型在生成、参考条件约束和编辑操作中保持连贯的共享历史。

为解决随历史增加而飙升的上下文读取成本,该模型引入了固定预算的稀疏上下文路由机制,并结合 ConstraintSink 确保任务约束始终可见。此外,研究提出两阶段特权上下文蒸馏框架,先通过一致性蒸馏从密集教师模型转移全上下文行为,再优化部署效果。

实验表明,该模型在多镜头任务中表现出优于专用基线的任务完成度与一致性,且在单张 GPU 上推理速度达到 16 FPS。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →