专题 · FULL STORY

FLUX 3:从官宣发布到实测爆火

Black Forest Labs 发布多模态大模型 FLUX 3,支持生成带原生音频的视频。该模型从早期预热、限量测试到正式推出,凭借惊艳的生成效果迅速引发社区大量实测与横评。

2026-07-22 ~ 2026-08-06 · 8 集 · 84 条

第 1 集 · Black Forest Labs 发布 FLUX 3:迈向全模态与具身智能底座(2026-07-22,28 条)

Black Forest Labs 正式发布 FLUX 3 模型,将其定位为迈向多模态 flow 模型的重要一步与视觉智能的基础架构。该模型采用统一架构,全面覆盖图像、视频、音频以及动作预测能力,标志着生成式 AI 正加速向具备“世界理解”能力的全模态底座演进。

已确认

  • 多模态与视频能力:FLUX 3 确认覆盖图像、视频、音频和动作生成。FLUX 3 Video 采用统一的图像/视频/音频架构,单次最长可生成 20 秒视频。该模型支持文生视频、图生视频、参考视频生成、音视频延长、关键帧控制、多语言对话以及智能多镜头剪辑等。
  • 开放节奏:FLUX 3 Video 已进入 early access 阶段并即将开源;视频原生音频生成同样进入早期测试。官方计划在未来几周到几个月内陆续开放图像编辑和开权重底座,动作预测则将通过部分科研和商业伙伴逐步开放。
  • 机器人部署:FLUX 3 的早期版本已在机器人上运行,并在机器人任务中表现出优于 REPA 的性能。mimic robotics 是首批早期访问合作伙伴之一,双方共同开发了 FLUX-mimic 模型;此外 Audi 也参与了相关部署。
  • 图像生成:官方已放出 FLUX 3 Image 的早期样张,展示了其在微距写实、平面插画和产品海报等多种风格上的成熟表现。

为什么重要

FLUX 3 的发布标志着生成模型不再局限于数字内容创作。特别是其动作预测能力的引入,以及在实际机器人(如 mimic robotics 和 Audi 项目)上的早期部署,展现了生成模型在物理世界交互和具身智能方向的巨大潜力,提出了“Real World Models”的全新概念。

还有 8 条相关讨论 →

第 2 集 · Black Forest Labs FLUX.3 开启早期测试,迈向全模态生成(2026-07-23,11 条)

Black Forest Labs(黑森林工作室)新一代模型 FLUX.3 已向部分用户开放早期测试,并放出了展示视频。首批测试者分享了惊艳的生成样张,传闻指出该模型将从单一图像生成转型为全模态骨干模型,覆盖视频、音频及机器人动作预测。

已确认

模型 FLUX.3 确实存在,官方已放出早期访问展示视频。部分测试者(如 @ostrisai)已获得体验权限并连续试玩数天,分享了大量生成结果,且提到开启了音频。此外还有疑似 Flux 3 或 Flux Video 的最新图像样本被分享出来。测试反馈显示该模型在画质与风格化生成上表现优异,@Eric520CC 认为其足以在开源图像模型领域再掀一次洗牌。

尚未确认

目前关于模型的具体多模态能力(如最长 20 秒视频、音频、机器人动作生成及推理能力)均来自爆料与预热信息。@multimodalart 指出 FLUX.3 [dev] 被描述为开放权重的多模态骨干模型,@eyishazyer 也推测其大概率会开放或开源权重,但官方尚未正式发布完整的技术规格与开源协议。

为什么重要

如果传闻属实,FLUX.3 将成为一款覆盖图像、视频、音频和动作预测的全面型多模态模型。这标志着顶级开源图像模型正式向更广阔的多模态生成与物理世界交互(机器人动作)领域迈进,对 AI 内容创作及具身智能领域具有重要意义。

第 3 集 · BFL 发布 FLUX 3:统一多模态底座切入视频与机器人(2026-07-24,12 条)

Black Forest Labs(BFL)正式发布 FLUX 3,这是一个统一的多模态底座,将图像、视频、原生音频和动作预测(Action Prediction)整合在同一个模型架构中。目前 FLUX 3 Video 已进入早期体验阶段,团队计划在未来几周到几个月内分批通过 API 和私有权重开放各项能力。该模型因展现出对物理世界的深刻理解,被业界视为迈向通用世界模拟器和机器人控制的重要节点。

已确认

FLUX 3 采用统一架构,能够同时处理图像、视频、音频和动作预测。官方强调新模型在不同风格下的生成结果更贴近真实物理感,其原生音频能力在实测反馈中获得好评。模型能力将通过 API 和私有权重逐步提供,目前 FLUX 3 Video 正处于收集反馈与安全测试的 Early Access 阶段。

尚未确认

关于 FLUX 3 是否会推出单独的“Klein”模型版本,目前官方信息表明 FLUX 3 更像是一组能力集合,而非单一独立模型。此外,用户指出目前决定该模型能否真正落地生产环境的关键指标(如具体延迟、并发限制和价格体系)仍未公开。

为什么重要

FLUX 3 的核心突破在于其动作预测能力。多位分析者(如 @MattVidPro、@rohanpaulai)指出,不同于仅依赖少量遥操作数据的传统 VLA 模型,FLUX 3 吸收了大规模视频预训练数据,从而更好地掌握了接触、形变和时间因果等物理规律。@imjustnewatai 等作者进一步认为,FLUX 3 将视频模型与机器人控制结合,印证了从视频生成走向世界模型、最终落地具身智能的技术演进路线。

第 4 集 · Black Forest Labs传将发布FLUX 3模型(2026-07-26,2 条)

传闻Black Forest Labs即将发布新一代生成模型FLUX 3。据爆料,该模型不仅会在多模态理解和图像生成质量上带来显著提升,更计划将图像、视频、音频和动作预测统一整合进同一模型中。这一升级引发了社区的广泛关注。

第 5 集 · Black Forest Labs 推出 FLUX 3 支持原生音频视频生成(2026-07-28,2 条)

Black Forest Labs 宣布推出 FLUX 3 模型,目前进入限量开放阶段。作为多模态创作工具的重大升级,该模型不仅能生成图像,还支持生成最长 20 秒的视频,并具备原生音频输出能力,实现了音视频与图像的一体化生成。

第 6 集 · Black Forest Labs发布FLUX 3多模态模型,支持原生音频视频生成(2026-08-04,19 条)

Black Forest Labs正式发布FLUX 3预览版,这是一个在图像、视频和音频上统一训练的多模态大模型。其核心亮点是能够通过单一请求生成带有同步原生音频的高清视频,单次最长可达20秒,标志着官方在构建真实“世界模型”道路上迈出重要一步。目前模型已进入早期体验阶段,API与网页端均已开放使用。

已确认

  • FLUX 3支持文生视频、图生视频(可设置首尾帧或多关键帧)、视频续写以及多语言对话功能。
  • 视频生成提供720p和1080p分辨率选项,单次最长20秒,并配备原生音频(含音效、环境音),同时提供低成本的Draft(草稿)模式。
  • 模型采用统一架构联合训练,能够在单次生成中切换场景与镜头角度,未来还将推出基于参考图的生成变体。
  • FLUX 3现已通过API向公众开放,并上线Runware以及图像处理平台Magnific,提供一站式生成与放大工作流。
  • 网页端已开放,用户可登录官网购买点数直接生成视频,目前仅上线视频生成功能,图像生成等其他功能后续推出。
  • 模型已上线Cloudflare AI Gateway,支持文生视频、图生视频和视频续写。
  • 官方宣布即将开放模型权重,API已向Replicate、Krea、Fal等合作平台开放。

尚未确认

  • 具体开放模型权重的时间表尚未公布。
  • 关于模型参数规模、训练数据等细节未披露。

为什么重要

  • 官方认为,单一模态只能捕捉现实的投影,而多模态联合学习能通过相互约束(如声音匹配撞击、运动遵循质量)更好地理解物理世界的底层规律。FLUX 3的发布不仅是视频生成能力的提升,更是向构建真实“世界模型”技术愿景迈进的关键尝试。

第 7 集 · Black Forest Labs发布FLUX 3视频模型引热议(2026-08-06,4 条)

Black Forest Labs 推出的 FLUX 3 视频生成模型在公开后迅速引发社区轰动。该模型展现出强大的提示词遵循与渲染能力,不仅能生成连贯的打斗场景和字幕卡,还原生内嵌了音频。用户基于其逼真的效果创作了大量极具创意的视频,包括伪造记忆与电影级预告片等复杂细节场景,充分展示了其在视频生成领域的突破。

第 8 集 · Flux 3 视频生成模型发布并引发实测横评(2026-08-06,6 条)

Black Forest Labs 发布开源视频生成模型 Flux 3,支持单次生成 20 秒带同步原生音频的片段,引发社区大量实测与横评。目前结论显示,Flux 3 在运镜和物理效果上优势明显,而竞品在时长和细节上各有千秋。

已确认

  • 要点 Flux 3 由 Black Forest Labs 开发并开源,支持单次生成 20 秒带同步音频片段,并能生成片名与完整动作戏。
  • 要点 Seedance(字节跳动)版本涵盖 2.0 至 2.5,最长支持 30 秒生成与 50 个参考输入,宽视角与过渡表现平滑。
  • 要点 MiniMax H3 在细节、灯光和时序同步上处理最佳。

为什么重要

  • 要点 本次实测横评直观展示了当前主流视频生成模型的核心差异与激烈竞争。作者 @eyishazyer 指出 Flux 3 在空中运镜、真实物理破坏效果、车门开合等复杂转场以及手部动作同步上表现极佳且稳定。相比之下,Seedance 2.5 在动作流畅度上略显滞后,顶配表现也稍逊一筹。@heypearlai 的多场景测试也验证了 Flux 3 在一镜到底穿梭房间和高难度动作场景中的连贯性与细节处理能力。