FLUX 3 把图像视频音频和动作预测统一进一个模型

robrombach · x · 2026-07-24

FLUX 3 把图像、视频、音频和动作预测做进同一模型

Black Forest Labs 发布 FLUX 3,称其是一个统一的多模态架构,覆盖 图像、视频、音频和动作预测。官方强调,新模型在不同风格下生成结果更接近真实世界;其中 FLUX 3 Video 已进入 early access。

更值得注意的是,官方表示它是在同一统一架构中联合训练的,并且可以进一步扩展到 机器人动作预测。线程还提到,这一路线与 mimic 和 Audi 的合作相关。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →