FLUX 3 把图像、视频、音频和动作预测合到一个模型里
GabGarrett · x · 2026-07-24
Black Forest Labs 发布 FLUX 3,把图像、视频、音频和动作预测放进同一个多模态模型里。帖子称 FLUX 3 Video 已进入早期访问阶段,且整套能力是用统一架构联合训练出来的。
更值得注意的是它的外延方向:团队明确提到模型可以继续扩展到动作预测,并在线程里提到与 Mimic、Audi 的合作,暗示这套多模态骨干也可走向机器人场景。
所属事件:Black Forest Labs 发布 FLUX 3:迈向全模态与具身智能底座(28 条相关)→
「具身」频道最新
- Flux 3 更像一组能力,不是单独的 Klein 模型 — carrot_2333 · 2026-07-24
- OpenAI Codex 键盘发货:首批上手称贵但好玩 — APPSO · 2026-07-24
- 8 美元 ESP32-S3 已能离线跑 2890 万参数模型 — brianrkelly · 2026-07-24
- 《时代》专访宇树科技:首款量产可变形机甲机器人GD01亮相 — whurley · 2026-07-24
- OpenBMB 在 WAIC 开源首个具身 AI 模型系列 — CyberRobooo · 2026-07-24
- 工业针织机器人皮肤,指向可规模化触觉感知 — mynkgoel · 2026-07-24