实时交互视频模型X2.0发布

量子位 · wechat · 2026-07-15

量子位介绍了 XmaxAI 全球首发的实时交互视频模型 X2.0。这次更新的重点不是单纯“生成视频”,而是把视频变成了可实时交互的媒介:用户可以通过摄像头、触屏、文字和空间动作去控制画面中的角色、服装、背景和物体。

文章里提到的主要能力包括:

技术上,文章强调它走的是流式逐帧自回归生成路线,而不是传统的整段视频联合生成;同时通过多阶段蒸馏、上下文持久化、稀疏化和 FP8 量化等方法,把实时性、质量与成本尽量同时做平衡。文中还提到,该模型可在消费级显卡和 iPhone 端侧运行,并开放 API。

应用层面,文章举了试衣、电商、虚拟陪伴、IP 互动、直播互动、智能硬件和文旅等想象空间。

所属事件:XMAX X2上线实时交互视频编辑(4 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →