Black Forest Labs 推出 FLUX 3:统一图像、视频与音频的多模态大模型

dl_weekly · x · 2026-08-04

Black Forest Labs 宣布其最新多模态基础模型 FLUX 3 进入早期体验阶段。该模型采用统一架构,将图像、视频和音频数据进行联合训练。

官方表示,这种多模态联合学习能让模型更好地理解物理世界的底层规律,例如物体的运动状态与声音的因果关系。目前,FLUX 3 已能生成带有原生音频的 20 秒视频片段,并展现出向机器人动作预测等物理 AI 领域扩展的潜力。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →