实时交互视频模型X2.0发布
量子位 · wechat · 2026-07-15
量子位介绍了 XmaxAI 全球首发的实时交互视频模型 X2.0。这次更新的重点不是单纯“生成视频”,而是把视频变成了可实时交互的媒介:用户可以通过摄像头、触屏、文字和空间动作去控制画面中的角色、服装、背景和物体。
文章里提到的主要能力包括:
- 实时渲染:实时替换摄像头/视频中的角色、服装与视觉风格,做到毫秒级响应。
- 次元交互:在现实场景中召唤、抚摸、对视或替换虚拟角色/物体。
- 触屏交互:拖拽静态主体,让图片或视频中的对象动起来。
- Free 模式:用 Prompt 进行特效创作,例如喷火、镭射眼、空间扭曲等。
技术上,文章强调它走的是流式逐帧自回归生成路线,而不是传统的整段视频联合生成;同时通过多阶段蒸馏、上下文持久化、稀疏化和 FP8 量化等方法,把实时性、质量与成本尽量同时做平衡。文中还提到,该模型可在消费级显卡和 iPhone 端侧运行,并开放 API。
应用层面,文章举了试衣、电商、虚拟陪伴、IP 互动、直播互动、智能硬件和文旅等想象空间。
所属事件:XMAX X2上线实时交互视频编辑(4 条相关)→
「多模态」频道最新
- 零编程经验者用 ChatGPT 开发 ComfyUI 安卓客户端将上架 — ComfierUI · 2026-09-11
- FastH3-Live 升至 22fps:加速节点实测与 ComfyUI 显存避坑 — spartong945 · 2026-09-11
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11