Wan-Streamer:视频即世界加事件流
Wan-AI · hf · 2026-07-17
Wan-Streamer v0.3:把视频看成“世界 + 事件流”
Wan-AI 发布 Wan-Streamer v0.3,用一个统一视角重构其实时流式交互模型:视频 = 稳定的世界 + 随时间变化的事件流。这里的“世界”包括环境、场景、人物、声音等相对稳定的上下文;“事件流”则是场景变化、人物动作、说话和其他声音等动态信息。
这个视角带来的训练目标
模型被训练成:给定一个世界和持续输入,实时预测这个世界如何变化、响应和推进。这样得到的能力可以迁移到多种实时下游任务。
具体落地
作者把它用于 实时全双工音视频交互:
- 输入是多模态用户内容
- 输出是语言形式的语音和行为动作
- 整体理解过程更像 vision-language-action 的实时版本
性能/系统指标
- 分辨率:640x368
- 帧率:25 FPS
- 流式单元:160 ms
- 模型侧响应延迟:约 200 ms
- 双向网络预算 350 ms 下,总交互延迟约 550 ms
这说明它不是纯概念展示,而是强调实时交互栈。
「多模态」频道最新
- 开发者用 GPT-6 Astra 搭配 Hyper3D Rodin 做出交互式 3D 产品展示 — nikola_mr64990 · 2026-09-11
- 用 MiniMax H3 MAX 对一只蚊子放大招,蚊子毫发无伤 — Hailuo_AI · 2026-09-11
- Skyfall GS 登场:用 Flux 提升 Gaussian Splatting 精修质量 — ducha_aiki · 2026-09-11
- AI 电影节 Lumara 将登陆纽约,顶级 AI 电影人齐聚评审 — 0xAllen_ · 2026-09-11
- 翼龙侦探:全程 AI 生成的概念片先导预告亮相 — PterodactylDetective · 2026-09-11
- Imperium 游戏预告片曝光,AI 视频生成再秀肌肉 — keaslenyt · 2026-09-11