HelloWorld: Enabling Socially Interactive Characters in Video World Models
Liangyang Ouyang, Ruicong Liu, Xuangeng Chu, Kaipeng Zhang, Yoichi Sato
cs.CV
2026-08-06
视频世界模型能控镜头却不能跟角色互动。HelloWorld 用自蒸馏保留基础模型的社交能力,再用一个免训练的注意力掩码把互动精准框在按键窗口内。
视频世界模型已经能控镜头、响应键盘、生成事件,但画面里的角色只是会动的像素,从不冲着观众打招呼。已有的「社交世界模型」基本是基于文本的 LLM,缺多模态视觉互动。HelloWorld 想填这个空:让用户按一下键,角色就在精准的时间窗里转向镜头、挥手、点头或说句问候,同时镜头还能照常被轨迹控制。
基础模型是 LTX-2.3,作者发现它其实天生就会生成丰富的社交互动,缺的只是镜头可控。所以核心问题变成:怎么加上镜头控制而不丢掉这份互动能力。三块设计。
自蒸馏训练管线。用带互动和镜头运动的四段式提示词让基础模型自己合成片段,用 Pi3X 估出每帧镜头位姿,把首帧点云沿轨迹重投影得到「warp video」作为显式的镜头运动条件,空缺的投影洞用可见 token 选择丢掉,再用 LoRA(rank 32)在 flow matching 损失下微调。关键是镜头提示词不进损失文本,镜头跟随只由 warp video 控制,避免提示泄漏。整个只用 156 段自合成视频、2000 步。
为什么互动和镜头运动要一起练:只拿真实镜头视频(无互动)练,模型只会学会补 warp 的洞,生成的动作不冲着观众。共练才能在学镜头条件的同时保住互动先验。
免训练的时间注意力掩码。按键打开一个时间窗,在 DiT 的交叉注意力 logits 上加掩码:窗外的帧被禁止去注意互动提示词的 token,于是互动只在窗内生效,角色在窗外保持环境动作。零训练、开销可忽略。
HelloWorldBench。120 张高质量图(人、动物、玩具、机器人)乘 4 种镜头轨迹乘早中晚时序,合成 400 样本、264 个角色、101 种互动。三个社交指标:动作准确率(做了什么)、时间准确率(何时做)、注视偏差(是否冲着观众),加三个常规指标(背景一致、美感、镜头可控)。
决定性优势在时间控制。
| 方法 | ActAcc | TimeAcc | GazeDev | CamCtrl |
| LingBot-World | 50.5 | 39.5 | 59.0 | 62.6 |
| LTX-2.3 基线 | 42.5 | 52.6 | 38.1 | 31.4 |
| HelloWorld | 41.4 | 81.7 | 40.2 | 82.9 |
TimeAcc 81.7 对一众基线的 30 到 39(三选一基本是随机 33%),这是掩码的胜利。美感 5.27、镜头可控 82.9、背景一致 96.9 都是全场最高。但动作准确率 41.4 不是最高,LingBot-World 50.5 更强,作者自己也承认。消融显示去掉掩码 ActAcc 反而最高(42.5),因为角色全程都在做动作,代价是丢了时间定位,这是个有意取舍。相对基线 LTX-2.3,每段推理只慢约 20%。
对做交互式视频和世界模型的人来说,「按键触发、精准定时、冲着观众」这套社交互动是新的能力维度,而且用 156 段自合成视频加一个免训练掩码就做到了,落地成本低。warp video 做镜头条件、注意力掩码做时间定位,是两个可拆开复用的组件。
作者承认做不到实时,生成靠预设轨迹和互动脚本,受基础模型和算力限制;持久身份和多轮持续互动是未来工作。目前的互动都是挥手、点头、打个招呼这类短动作,没有持续对话;聚焦单角色,不支持一段视频里多角色对话。训练只有 156 段,泛化广度存疑。动作准确率输给 LingBot-World,赢的是时间控制和画面质量,不是原始动作识别。注视偏差只在 217 个人类样本上估,动物和玩具的「冲着观众」没有量化。整套 benchmark 是作者自建的,还没有第三方复测。