FLUX 3 把图像视频音频和动作预测做进一个模型
robrombach · x · 2026-07-24
这条转发在强调 FLUX 3 的多模态一体化能力:同一个模型同时处理 图像、视频、音频和动作预测,并且对世界如何“看、动、听、交互”有更丰富的理解。
被转述的实测反馈里提到几个具体点:
- 原生音频 被评价为视频生成里最强之一
- 可生成最长 20 秒 的视频
- 支持 图像 / 视频 / 音频 输入
- 最多可同时使用 10 个参考输入,而且可以自由混搭
整体信息指向的是一个更强的多模态生成模型,而不只是单一视频模型升级。
所属事件:Black Forest Labs 发布 FLUX 3 统一多模态底座(7 条相关)→
「多模态」频道最新
- Hyper3D Rodin 推出 BANG:零件级 3D 模型可变交互资产 — xiaohu · 2026-07-24
- Hyper3D 解释 3D 分件原理:沿真实结构缝自动拆分 — xiaohu · 2026-07-24
- Hyper3D 增加手动分件选择,让 3D 拆解更精细 — xiaohu · 2026-07-24
- Hyper3D 推出 BANG to Parts,可将完整 3D 模型拆成可编辑零件 — xiaohu · 2026-07-24
- Anthropic 工程师详解,如何搭建可靠 agent 评测框架 — iamrobotbear · 2026-07-24
- 有人让 ChatGPT 把键盘配色同步到 Spotify 专辑封面 — prd_008 · 2026-07-24