Wan-Streamer:把视频看成世界+事件流

bronzeagepapi · x · 2026-07-18

阿里 Wan 团队提出 Wan-Streamer v0.3,核心观点是把视频统一理解为 “世界 + 事件流”。

这样定义后,模型可以把“给定世界和输入,实时预测世界如何移动、变化和响应”作为通用预训练任务。论文还强调它面向实时全双工音视频交互:把事件流当作 agent 的语言、行为和动作输出,目标是低延迟同步生成。图中给出的指标包括 640×368、25 FPS、160ms streaming unit、约 200ms 模型侧响应延迟、约 550ms 总交互延迟(在 350ms 双向网络预算下)。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →