Black Forest Labs 推出 Flux 3,支持最长 20 秒原生音频视频生成

The Decoder · rss · 2026-07-24

Black Forest Labs 发布了 Flux 3,这是一款同时学习图像、视频和音频的多模态基础模型。

它最重要的能力是原生生成带声音的视频,最长可到 20 秒。公司自测结果称它略优于 Seedance 2.0,但目前还没有独立基准验证。BFL 还表示,最终目标是做世界模型,并且已经把 Flux 3 用到机器人任务测试中。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →