生数 Vidu S2 发布:边播边改视频,实时换装换脸换背景
量子位 · wechat · 2026-09-15
生数科技发布 Vidu S2,距上一代仅 69 天,发布当天全量开放。核心升级三块:
- S2-Editing:对正在播放的视频流实时换装、换人物、换背景、换风格,堪称视频版实时 P 图;实测人物一致性与服装形变较自然,偶有涂抹感与穿模。
- S2-Avatar:实时交互数字人升级到 720P(上代 540p),支持语音控制大幅动作(跳舞、转身),互动中可随时递入参考图让角色拿起指定物品或换装。
- 实时空间视频:可将生成/编辑视频转为双目立体画面送进 VR 头显,把真实世界当「画布」创作。
技术要点:用 Self-Replay Forcing 解决流式生成误差累积;Backbone-Refiner 两阶段架构加异步流水线实现 720P 不掉帧;重新设计位置编码将参考图注入与时间戳对齐,实现「从某时刻开始换」;VLMAgent 充当「执行导演」跟踪画面状态并规划生成;双向与流式两阶段分别用 DPO 和 Streaming NFT 做强化学习。项目由清华朱军教授博士生张金涛负责,技术报告已放出。
所属事件:生数发布 Vidu S2:实时交互、可编辑的空间视频生成(5 条相关)→
「多模态」频道最新
- Reddit 网友展示自用 AI 制作的短视频作品 — anotheraccountaus · 2026-09-15
- 一条视频生成 4D 高斯泼溅,4DAnyone 实测体验分享 — mickmumpitz · 2026-09-15
- 《Lost Souls》:AI 生成的电影感短片章节亮相 Reddit — Choice_Mongoose7320 · 2026-09-15
- 42 秒渲染一帧的 Blender 官方图被转成 3D 高斯泼溅实时浏览 — willeastcott · 2026-09-15
- DeepMind 实习成果:把价值图放进 VLM 思维链,多模态潜在推理提效 20% — burny_tech · 2026-09-15
- 被嘲「AI slop」的中国创作者,把 AI 视频做成了职业 — HeyZoyaKhan · 2026-09-15