Black Forest Labs 推出 FLUX 3:统一图像、视频与音频的多模态大模型
dl_weekly · x · 2026-08-04
Black Forest Labs 宣布其最新多模态基础模型 FLUX 3 进入早期体验阶段。该模型采用统一架构,将图像、视频和音频数据进行联合训练。
官方表示,这种多模态联合学习能让模型更好地理解物理世界的底层规律,例如物体的运动状态与声音的因果关系。目前,FLUX 3 已能生成带有原生音频的 20 秒视频片段,并展现出向机器人动作预测等物理 AI 领域扩展的潜力。
「模型」频道最新
- Hugging Face 发布 LFM2.5-2.6B:主打本地端侧 Agent 部署 — Hugging Face Blog · 2026-08-04
- 闭源前沿模型编码频频过度设计,开发者直呼引发工程危机 — robleclerc · 2026-08-04
- 实测 DeepSeek 与 Qwen 复刻《雨世界》游戏氛围 — yacineMTB · 2026-08-04
- 简单任务用前沿大模型是浪费?多模型路由将成趋势 — zerogpu_ai · 2026-08-04
- NVIDIA 发布 VoiceChat-11B 语音交互模型 — nvidia · 2026-08-04
- MiniMax H3 发布:小尺寸 Transformer,支持文生视频 — beatlepol · 2026-08-04