FLUX 3 把图像视频音频和动作预测做进一个模型

robrombach · x · 2026-07-24

这条转发在强调 FLUX 3 的多模态一体化能力:同一个模型同时处理 图像、视频、音频和动作预测,并且对世界如何“看、动、听、交互”有更丰富的理解。

被转述的实测反馈里提到几个具体点:

整体信息指向的是一个更强的多模态生成模型,而不只是单一视频模型升级。

所属事件:Black Forest Labs 发布 FLUX 3 统一多模态底座(7 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →