Black Forest Labs 推出 Flux 3,支持最长 20 秒原生音频视频生成
The Decoder · rss · 2026-07-24
Black Forest Labs 发布了 Flux 3,这是一款同时学习图像、视频和音频的多模态基础模型。
它最重要的能力是原生生成带声音的视频,最长可到 20 秒。公司自测结果称它略优于 Seedance 2.0,但目前还没有独立基准验证。BFL 还表示,最终目标是做世界模型,并且已经把 Flux 3 用到机器人任务测试中。
「具身」频道最新
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- 蚂蚁阿福用户达 1.5 亿,外滩大会展示 AI+硬件健康管理联盟 — APPSO · 2026-09-11
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11
- SyncWorld:少量视觉校准即可零样本模拟机器人跨视角交互 — ChongZzZhang · 2026-09-11
- 狗类 3D 姿态数据集发布,动物动捕研究可用 — ducha_aiki · 2026-09-11
- Swaayatt 演示山区高速自动驾驶:52km/h 过盲弯失控后自稳 — sanjeevs_iitr · 2026-09-11