FLUX 3 把图像、视频、音频和动作预测合到一个模型里

GabGarrett · x · 2026-07-24

Black Forest Labs 发布 FLUX 3,把图像、视频、音频和动作预测放进同一个多模态模型里。帖子称 FLUX 3 Video 已进入早期访问阶段,且整套能力是用统一架构联合训练出来的。

更值得注意的是它的外延方向:团队明确提到模型可以继续扩展到动作预测,并在线程里提到与 Mimic、Audi 的合作,暗示这套多模态骨干也可走向机器人场景。

所属事件:Black Forest Labs 发布 FLUX 3:迈向全模态与具身智能底座(28 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →