专题 · FULL STORY

Wan 3.0:从神秘预告到实测惊艳

8月23日起多位博主预告一款可秒级生成有声视频的神秘模型,次日阿里通义万相官宣为 Wan 3.0,支持30秒文档转视频并在多平台上线。随后用户实测显示其多镜头调度与音画生成能力亮眼,被认为有望挑战 SeeDance。

2026-08-23 ~ 2026-08-25 · 3 集 · 21 条

第 1 集 · 神秘新视频模型预告:秒级生成有声视频(2026-08-23,5 条)

本周将有一款神秘的新视频生成模型发布,多位博主和开发者陆续预告其能力:生成含声音的短视频仅需约 2 秒,快于视频播放时长,且在原生分辨率下生成音频、不使用任何降质手段,具体技术细节尚未公开。

已确认

  • 博主 markk 于 8 月 23 日预告,该模型 2 秒即可生成一段包含声音的 10 秒视频,生成质量相当不错。
  • 开发者 isidentical 的预告给出更具体的特性:原生音频、原生分辨率输出,声称 2 秒内生成 5 秒视频;明确不使用缓存、量化、稀疏注意力等降低质量的手段,并借此批评近期许多采用此类技巧的服务。
  • 博主 bennash 指出该模型生成速度快于播放时长(如生成 5 秒视频仅需 4 秒),用户可批量输入提示词、几乎无等待地连续观看;他认为当质量与提示词控制达到电影级水准时,将带来实时按需生成视频的体验。
  • 开发者 altryne 同样预告了原生分辨率音频视频生成、拒绝降质的特性,并宣称将发布独立第三方基准测试结果,表示这将改变视频生成领域的格局。

尚未确认

  • 模型名称、技术细节与发布方身份尚未公开。
  • 生成速度(2 秒生成 5 秒还是 10 秒视频)在不同帖子中的说法略有出入,以正式发布为准。

为什么重要

  • 若生成速度快于播放时长属实,视频生成将从「等待产出」转向「实时按需生成」,改变内容消费和创作的工作流。
  • 对缓存、量化、稀疏注意力的公开批评,直接指向当前主流视频生成服务的隐性降质问题,独立第三方基准测试若发布,可能成为行业质量对比的新参照。

第 2 集 · 阿里发布 Wan 3.0:30秒文档转视频,多平台上线(2026-08-24,14 条)

8月24日,阿里通义万相团队正式发布视频生成模型 Wan 3.0,从8月6日开始的公测转为正式发布。据@Scobleizer转述的演示信息,其生成视频的速度快于视频本身的播放时长,接近实时生成水平。用户可在阿里云百炼、千问AI等平台体验,API 限时7折优惠。

已确认

  • 生成长度:单次可原生生成最长30秒带音频视频,无需拼接,原生支持同步音频。
  • 一致性:据@LudovicCreator转述,可在30秒内保持人物、对话、镜头、多场景切换及唇形同步的高度一致性;Magnific 平台演示展示了跨22年、三个年龄段和13个场景的人物面部一致性。
  • 控制能力:支持文生视频、首帧与尾帧控制,Runware 上最多支持20个参考输入。
  • 多模态输入:FAL 上支持文本、图片、音频、视频、网页及文档作为输入;据@heypearlai介绍,可直接读取 DOC、XLS、PPT、PDF 和 Markdown 文件,实现"投文档出视频"工作流。
  • 实测反馈:据@OdinLovis转述,实测者认为其相比 2.7 版本不只是更新,更像一个全新模型,质量稳定且显著提升,社区并已出现面向30秒视频时代的 Prompt 编写技巧分享。
  • 应用情况:据@sunychoudhary转述,公测期间模型已被用于短剧、电影制作、广告营销、旅游推广和音乐视频创作。
  • 平台覆盖:发布当日已上线 FAL、Runware、Magnific 及 Leonardo,次日 Runway 也正式宣布上线 WAN 3.0;据@runwayml介绍,该模型支持使用多张图像、视频和音频作为参考输入来控制生成结果。
  • 背景:据@talkingatoms引述路透社报道,此次发布紧随阿里巴巴完成100亿美元股票出售之后。

为什么重要

  • 30秒原生长视频生成与接近实时的速度,明显缩小了AI视频与实用化生产之间的差距。
  • 丰富的参考输入(多模态文档、首尾帧、多参考图像)降低了可控叙事与广告等场景的制作门槛,"投文档出视频"尤其贴近内容生产工作流。
  • 发布两日内即接入 FAL、Runware、Magnific、Leonardo、Runway 五个第三方平台,生态扩张迅速,开发者可即刻调用,且公测期已在影视、营销等真实场景落地。

第 3 集 · WAN 3.0 实测亮眼,用户称有望挑战 SeeDance(2026-08-24,2 条)

多位用户分享了 WAN 3.0 的生成实测。一段纯文本生成(无参考图)的 30 秒床具对抗奇幻视频中,模型自动完成多镜头调度、布料物理模拟及背景配乐,一次性生成成功且质量极高。有用户称其可能成为新的视频模型之王,并具备挑战 SeeDance 2.5 的实力。