Wan-Streamer:把视频看成世界+事件流
bronzeagepapi · x · 2026-07-18
阿里 Wan 团队提出 Wan-Streamer v0.3,核心观点是把视频统一理解为 “世界 + 事件流”。
- 世界:场景、人物、声音、环境等相对稳定的上下文
- 事件流:随时间变化的内容,如说话、动作、手势、声音反应等
这样定义后,模型可以把“给定世界和输入,实时预测世界如何移动、变化和响应”作为通用预训练任务。论文还强调它面向实时全双工音视频交互:把事件流当作 agent 的语言、行为和动作输出,目标是低延迟同步生成。图中给出的指标包括 640×368、25 FPS、160ms streaming unit、约 200ms 模型侧响应延迟、约 550ms 总交互延迟(在 350ms 双向网络预算下)。
「多模态」频道最新
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- 开发者用 GPT-6 Astra 搭配 Hyper3D Rodin 做出交互式 3D 产品展示 — nikola_mr64990 · 2026-09-11
- 用 MiniMax H3 MAX 对一只蚊子放大招,蚊子毫发无伤 — Hailuo_AI · 2026-09-11
- Skyfall GS 登场:用 Flux 提升 Gaussian Splatting 精修质量 — ducha_aiki · 2026-09-11
- AI 电影节 Lumara 将登陆纽约,顶级 AI 电影人齐聚评审 — 0xAllen_ · 2026-09-11
- 翼龙侦探:全程 AI 生成的概念片先导预告亮相 — PterodactylDetective · 2026-09-11