HelloWorld:视频世界模型支持与虚拟角色实时社交互动
Liangyang Ouyang · hf · 2026-08-06
现有视频世界模型缺乏用户与虚拟角色的社交互动能力。本文提出 HelloWorld,允许用户通过按键触发屏幕内角色的社交反应(如转身、挥手、说话)。
- 自蒸馏管线:利用模型自身合成的包含社交互动和相机运动的数据微调模型,避免互动质量下降。
- 免训练推理模块:在按键时调制 DiT 的交叉注意力掩码,将互动提示限定在特定时间窗口,实现角色响应的时间定位。
- 评测基准:构建了包含 400 个样本的 HelloWorldBench。实验表明该模型在保持顶尖画质和相机姿态跟随的同时,超越了多种基线的互动质量。
「多模态」频道最新
- MiniMax H3 模型实测:生成高质量黑帮动画 — turkey_is_dead · 2026-08-06
- MiniMax H3 进阶影视工作流:从提示词到剪辑 — Tricky_Algae2625 · 2026-08-06
- 网友实测 LTX 放大器:低显存跑高分辨率图像 — AniZeee · 2026-08-06
- 马斯克宣布推出 Grok Imagine 图片生成功能 — elonmusk · 2026-08-06
- Meta 揭示多模态预训练机制:仅用 5% 算力实现强劲生成 — facebook · 2026-08-06
- UniWorld-View: 基于视频扩散的大基线新视角合成框架 — Haiyang Zhou · 2026-08-06