专题 · FULL STORY
Black Forest Labs 发布 FLUX 3 多模态模型
Black Forest Labs 从预热到正式发布 FLUX 3 模型,展示了其在图像生成等视觉能力上的显著提升。该模型采用统一架构,不仅覆盖视频与音频,更被视作迈向全模态与具身智能底座的重要一步。
2026-07-22 ~ 2026-07-24 · 4 集 · 40 条
第 1 集 · Black Forest Labs 发布 FLUX 3:迈向全模态与具身智能底座(2026-07-22,28 条)
Black Forest Labs 正式发布 FLUX 3 模型,将其定位为迈向多模态 flow 模型的重要一步与视觉智能的基础架构。该模型采用统一架构,全面覆盖图像、视频、音频以及动作预测能力,标志着生成式 AI 正加速向具备“世界理解”能力的全模态底座演进。
已确认
* **多模态与视频能力**:FLUX 3 确认覆盖图像、视频、音频和动作生成。FLUX 3 Video 采用统一的图像/视频/音频架构,单次最长可生成 20 秒视频。该模型支持文生视频、图生视频、参考视频生成、音视频延长、关键帧控制、多语言对话以及智能多镜头剪辑等。
* **开放节奏**:FLUX 3 Video 已进入 early access 阶段并即将开源;视频原生音频生成同样进入早期测试。官方计划在未来几周到几个月内陆续开放图像编辑和开权重底座,动作预测则将通过部分科研和商业伙伴逐步开放。
* **机器人部署**:FLUX 3 的早期版本已在机器人上运行,并在机器人任务中表现出优于 REPA 的性能。mimic robotics 是首批早期访问合作伙伴之一,双方共同开发了 FLUX-mimic 模型;此外 Audi 也参与了相关部署。
* **图像生成**:官方已放出 FLUX 3 Image 的早期样张,展示了其在微距写实、平面插画和产品海报等多种风格上的成熟表现。
为什么重要
FLUX 3 的发布标志着生成模型不再局限于数字内容创作。特别是其动作预测能力的引入,以及在实际机器人(如 mimic robotics 和 Audi 项目)上的早期部署,展现了生成模型在物理世界交互和具身智能方向的巨大潜力,提出了“Real World Models”的全新概念。
- Flux 3 被预告为图文视频音频一体模型 — rerri · 2026-07-22
- Flux 3 被曝将覆盖图像视频音频与动作生成 — Angaisb_ · 2026-07-22
- Black Forest Labs 传出 Flux 3:图像视频音频动作一体 — ZeroStateReflex · 2026-07-23
- 黑森林工作室疑似预告 FLUX 3, 主打全模态生成 — op7418 · 2026-07-23
- Black Forest Labs 推出 FLUX 3,覆盖图像视频音频与动作预测 — bfl_ai · 2026-07-23
- FLUX 3 将陆续开放原生音频、图像编辑和开权重底座 — bfl_ai · 2026-07-23
- FLUX 3 已通过 mimic 和 Audi 部署跑上机器人 — bfl_ai · 2026-07-23
- Black Forest Labs 放出 FLUX 3 Image 早期样张 — bfl_ai · 2026-07-23
- Black Forest Labs 将 FLUX 3 定位为视觉智能的多模态底座 — stephen370 · 2026-07-23
- FLUX 3 被描述为面向多模态生成的 Self-Flow 系统 — hila_chefer · 2026-07-23
- Black Forest Labs 推出 FLUX-3:统一图像、视频与音频架构 — nathanbenaich · 2026-07-23
- FLUX 3 提出 Real World Models,主打多模态视觉智能 — MoistRecognition69 · 2026-07-23
- FLUX 3 被称在机器人任务上超过 REPA — hila_chefer · 2026-07-23
- 黑森林工作室称 Flux 3 视频模型开源,支持全模态生成 — op7418 · 2026-07-23
- BlackForestLabs 发布并即将开源 FLUX 3 视频生成模型 — 歸藏的AI工具箱 · 2026-07-23
- Black Forest Labs 发布覆盖图像视频音频的 FLUX 3 — chrisfirst · 2026-07-23
- Black Forest Labs 发布 FLUX 3:统一多模态覆盖图像视频音频 — daniel_mac8 · 2026-07-24
- Flux 3 被定位为图像视频推理一体多模态模型 — mark_k · 2026-07-24
- FLUX 3 把图像、视频、音频和动作预测合到一个模型里 — GabGarrett · 2026-07-24
- Stable Diffusion 公布 FLUX 3,兼具图像视频与原生音频生成 — imjustnewatai · 2026-07-24
第 2 集 · Black Forest Labs 预热 FLUX.3:迈向全模态骨干模型(2026-07-23,7 条)
Black Forest Labs(黑森林工作室)正在预热其新一代模型 FLUX.3,并已向部分用户开放早期测试,曝光的演示视频和样本展示了其显著提升的图像生成能力。据多方爆料,FLUX.3 将从单一的静态图像模型转型为全模态骨干模型,不仅支持图像生成,还涵盖了最长 20 秒的视频、音频以及机器人动作预测,并可能内置推理能力。
已确认
模型 FLUX.3 确实存在,且 Black Forest Labs 已放出早期访问展示视频。部分测试者已将其投入早期测试并分享了惊艳的生成效果,此外还有疑似 Flux 3 或 Flux Video 的最新图像样本被分享出来。
尚未确认
目前关于模型的具体多模态能力(如 20 秒视频、音频、动作生成及推理能力)均来自爆料与预热传闻。虽然 @eyishazyer 和 @multimodalart 推测该模型大概率会延续其一贯路线开放或开源权重,但官方尚未正式发布完整的技术规格与开源协议确认。
为什么重要
如果传闻属实,FLUX.3 将成为一款覆盖图像、视频、音频和动作预测的全面型多模态模型。这标志着顶级开源图像模型正式向更广阔的多模态生成与物理世界交互(机器人动作)领域迈进,对 AI 内容创作及具身智能领域具有重要意义。
- Flux 3 传闻加入图像、20 秒视频和推理 — mark_k · 2026-07-23
- FLUX 3 预热视频曝光,疑似支持 20 秒多模态生成 — eyishazyer · 2026-07-23
- FLUX 3 模型早期测试展示放出 — MFGREBEL · 2026-07-23
- Black Forest Labs 预热开放权重多模态骨干 FLUX.3 — multimodalart · 2026-07-24
- Black Forest Labs 新一代图像模型 FLUX 3 开启测试 — AIandDesign · 2026-07-24
- Flux 3/Flux Video 曝光最新图像样本 — koltregaskes · 2026-07-24
- @AIandDesign 发帖称 FLUX 3 回来了 — AIandDesign · 2026-07-24
第 3 集 · 网友推测OpenAI正通过视频模型布局机器人(2026-07-24,2 条)
网友通过梳理FLUX 3、Sora 2等产品的线索,推测这反映了OpenAI的长期战略路线:即从视频模型走向世界模型,最终发展出行动能力并落地到个人机器人领域。相关证据包括FLUX 3作为控制机器人的视觉模型,以及Sora 2指向世界模拟器与机器人智能体的潜在定位。
- FLUX 3 被指示意 OpenAI 路线:视频模型走向个人机器人 — imjustnewatai · 2026-07-24
- 一条线程整理 FLUX 3、Sora 2 与 OpenAI 机器人证据 — imjustnewatai · 2026-07-24
第 4 集 · BFL 发布 FLUX 3 统一多模态大模型(2026-07-24,3 条)
Black Forest Labs(BFL)正式发布了 FLUX 3 模型,致力于打造统一的多模态架构。该模型将图像生成、视频处理、音频合成以及动作预测等多项能力整合到了同一个模型体系内。其中包含 FLUX 3 Video 等具体组件,展示了其在跨模态理解和生成方面的技术突破,标志着多模态 AI 架构正向更加高度整合的方向发展。
- FLUX 3 把图像视频音频和动作预测统一进一个模型 — robrombach · 2026-07-24
- BFL 发布 FLUX 3:统一图像、视频、音频与动作预测模型 — umesh_ai · 2026-07-24
- FLUX 3 把图像、视频、音频和动作预测合成一体 — Eric520CC · 2026-07-24