专题 · FULL STORY

FLUX 3多模态模型:从发布到实测霸榜

Black Forest Labs发布FLUX 3多模态模型,统一图像、视频、音频与动作预测。模型发布后引发实测热潮,并在LMArena等榜单中名列前茅,展现出惊艳的真实感与运镜能力。

2026-07-22 ~ 2026-08-14 · 13 集 · 100 条

第 1 集 · Black Forest Labs 发布 FLUX 3:迈向全模态与具身智能底座(2026-07-22,28 条)

Black Forest Labs 正式发布 FLUX 3 模型,将其定位为迈向多模态 flow 模型的重要一步与视觉智能的基础架构。该模型采用统一架构,全面覆盖图像、视频、音频以及动作预测能力,标志着生成式 AI 正加速向具备“世界理解”能力的全模态底座演进。

已确认

  • 多模态与视频能力:FLUX 3 确认覆盖图像、视频、音频和动作生成。FLUX 3 Video 采用统一的图像/视频/音频架构,单次最长可生成 20 秒视频。该模型支持文生视频、图生视频、参考视频生成、音视频延长、关键帧控制、多语言对话以及智能多镜头剪辑等。
  • 开放节奏:FLUX 3 Video 已进入 early access 阶段并即将开源;视频原生音频生成同样进入早期测试。官方计划在未来几周到几个月内陆续开放图像编辑和开权重底座,动作预测则将通过部分科研和商业伙伴逐步开放。
  • 机器人部署:FLUX 3 的早期版本已在机器人上运行,并在机器人任务中表现出优于 REPA 的性能。mimic robotics 是首批早期访问合作伙伴之一,双方共同开发了 FLUX-mimic 模型;此外 Audi 也参与了相关部署。
  • 图像生成:官方已放出 FLUX 3 Image 的早期样张,展示了其在微距写实、平面插画和产品海报等多种风格上的成熟表现。

为什么重要

FLUX 3 的发布标志着生成模型不再局限于数字内容创作。特别是其动作预测能力的引入,以及在实际机器人(如 mimic robotics 和 Audi 项目)上的早期部署,展现了生成模型在物理世界交互和具身智能方向的巨大潜力,提出了“Real World Models”的全新概念。

还有 8 条相关讨论 →

第 2 集 · Black Forest Labs FLUX.3 开启早期测试,迈向全模态生成(2026-07-23,11 条)

Black Forest Labs(黑森林工作室)新一代模型 FLUX.3 已向部分用户开放早期测试,并放出了展示视频。首批测试者分享了惊艳的生成样张,传闻指出该模型将从单一图像生成转型为全模态骨干模型,覆盖视频、音频及机器人动作预测。

已确认

模型 FLUX.3 确实存在,官方已放出早期访问展示视频。部分测试者(如 @ostrisai)已获得体验权限并连续试玩数天,分享了大量生成结果,且提到开启了音频。此外还有疑似 Flux 3 或 Flux Video 的最新图像样本被分享出来。测试反馈显示该模型在画质与风格化生成上表现优异,@Eric520CC 认为其足以在开源图像模型领域再掀一次洗牌。

尚未确认

目前关于模型的具体多模态能力(如最长 20 秒视频、音频、机器人动作生成及推理能力)均来自爆料与预热信息。@multimodalart 指出 FLUX.3 [dev] 被描述为开放权重的多模态骨干模型,@eyishazyer 也推测其大概率会开放或开源权重,但官方尚未正式发布完整的技术规格与开源协议。

为什么重要

如果传闻属实,FLUX.3 将成为一款覆盖图像、视频、音频和动作预测的全面型多模态模型。这标志着顶级开源图像模型正式向更广阔的多模态生成与物理世界交互(机器人动作)领域迈进,对 AI 内容创作及具身智能领域具有重要意义。

第 3 集 · BFL 发布 FLUX 3:统一多模态底座切入视频与机器人(2026-07-24,12 条)

Black Forest Labs(BFL)正式发布 FLUX 3,这是一个统一的多模态底座,将图像、视频、原生音频和动作预测(Action Prediction)整合在同一个模型架构中。目前 FLUX 3 Video 已进入早期体验阶段,团队计划在未来几周到几个月内分批通过 API 和私有权重开放各项能力。该模型因展现出对物理世界的深刻理解,被业界视为迈向通用世界模拟器和机器人控制的重要节点。

已确认

FLUX 3 采用统一架构,能够同时处理图像、视频、音频和动作预测。官方强调新模型在不同风格下的生成结果更贴近真实物理感,其原生音频能力在实测反馈中获得好评。模型能力将通过 API 和私有权重逐步提供,目前 FLUX 3 Video 正处于收集反馈与安全测试的 Early Access 阶段。

尚未确认

关于 FLUX 3 是否会推出单独的“Klein”模型版本,目前官方信息表明 FLUX 3 更像是一组能力集合,而非单一独立模型。此外,用户指出目前决定该模型能否真正落地生产环境的关键指标(如具体延迟、并发限制和价格体系)仍未公开。

为什么重要

FLUX 3 的核心突破在于其动作预测能力。多位分析者(如 @MattVidPro、@rohanpaulai)指出,不同于仅依赖少量遥操作数据的传统 VLA 模型,FLUX 3 吸收了大规模视频预训练数据,从而更好地掌握了接触、形变和时间因果等物理规律。@imjustnewatai 等作者进一步认为,FLUX 3 将视频模型与机器人控制结合,印证了从视频生成走向世界模型、最终落地具身智能的技术演进路线。

第 4 集 · Black Forest Labs传将发布FLUX 3模型(2026-07-26,2 条)

传闻Black Forest Labs即将发布新一代生成模型FLUX 3。据爆料,该模型不仅会在多模态理解和图像生成质量上带来显著提升,更计划将图像、视频、音频和动作预测统一整合进同一模型中。这一升级引发了社区的广泛关注。

第 5 集 · Black Forest Labs 推出 FLUX 3 支持原生音频视频生成(2026-07-28,2 条)

Black Forest Labs 宣布推出 FLUX 3 模型,目前进入限量开放阶段。作为多模态创作工具的重大升级,该模型不仅能生成图像,还支持生成最长 20 秒的视频,并具备原生音频输出能力,实现了音视频与图像的一体化生成。

第 6 集 · Black Forest Labs发布FLUX 3多模态模型,支持原生音频视频生成(2026-08-04,19 条)

Black Forest Labs正式发布FLUX 3预览版,这是一个在图像、视频和音频上统一训练的多模态大模型。其核心亮点是能够通过单一请求生成带有同步原生音频的高清视频,单次最长可达20秒,标志着官方在构建真实“世界模型”道路上迈出重要一步。目前模型已进入早期体验阶段,API与网页端均已开放使用。

已确认

  • FLUX 3支持文生视频、图生视频(可设置首尾帧或多关键帧)、视频续写以及多语言对话功能。
  • 视频生成提供720p和1080p分辨率选项,单次最长20秒,并配备原生音频(含音效、环境音),同时提供低成本的Draft(草稿)模式。
  • 模型采用统一架构联合训练,能够在单次生成中切换场景与镜头角度,未来还将推出基于参考图的生成变体。
  • FLUX 3现已通过API向公众开放,并上线Runware以及图像处理平台Magnific,提供一站式生成与放大工作流。
  • 网页端已开放,用户可登录官网购买点数直接生成视频,目前仅上线视频生成功能,图像生成等其他功能后续推出。
  • 模型已上线Cloudflare AI Gateway,支持文生视频、图生视频和视频续写。
  • 官方宣布即将开放模型权重,API已向Replicate、Krea、Fal等合作平台开放。

尚未确认

  • 具体开放模型权重的时间表尚未公布。
  • 关于模型参数规模、训练数据等细节未披露。

为什么重要

  • 官方认为,单一模态只能捕捉现实的投影,而多模态联合学习能通过相互约束(如声音匹配撞击、运动遵循质量)更好地理解物理世界的底层规律。FLUX 3的发布不仅是视频生成能力的提升,更是向构建真实“世界模型”技术愿景迈进的关键尝试。

第 7 集 · Black Forest Labs发布FLUX 3视频模型引热议(2026-08-06,3 条)

Black Forest Labs 推出的 FLUX 3 视频生成模型在公开后迅速引发社区轰动。该模型展现出强大的提示词遵循与渲染能力,不仅能生成连贯的打斗场景和字幕卡,还原生内嵌了音频。用户基于其逼真的效果创作了大量极具创意的视频,包括伪造记忆与电影级预告片等复杂细节场景,充分展示了其在视频生成领域的突破。

第 8 集 · Flux 3 发布引实测热潮,多模型横评竞争激烈(2026-08-06,10 条)

Black Forest Labs 发布开源视频生成模型 Flux 3,支持单次生成 20 秒带同步原生音频的片段,并能生成片名与完整动作戏。该发布迅速引发社区实测热潮,多位创作者将其与 Seedance、MiniMax H3 等主流模型进行横评。目前结论显示,Flux 3 在运镜、物理破坏效果及复古影像创作上优势明显,但在整体能力排名上仍存争议,竞品在专业应用、细节处理和综合表现上各有千秋。

已确认

  • Flux 3 由 Black Forest Labs 开发并开源,支持单次生成 20 秒带同步音频片段,并能生成片名与完整动作戏。
  • Seedance(字节跳动)版本涵盖 2.0 至 2.5,最长支持 30 秒生成与 50 个参考输入。
  • MiniMax H3 在细节、灯光和时序同步上处理最佳。

尚未确认

  • 模型间的绝对实力排名仍无定论。作者 @flowersslop 通过“霸王龙对战大象”提示词测试后认为,Flux 3 虽优于多数模型,但仍不敌数月前发布的 Seedance 2,给出的综合排名为 Seedance 2.5 领先,Flux 3 位居第二。

为什么重要

  • 本次实测横评直观展示了当前主流视频生成模型的核心差异与激烈竞争。作者 @eyishazyer 指出 Flux 3 在空中运镜、真实物理破坏效果、车门开合等复杂转场以及手部动作同步上表现极佳且稳定。相比之下,Seedance 2.5 在动作流畅度上略显滞后,Seedance 2.0 顶配表现也稍逊一筹。
  • 作者 @heypearlai 的多场景测试验证了 Flux 3 在一镜到底穿梭房间和高难度动作场景中的连贯性与细节处理能力。
  • 作者 @gorkem 在对比后表示,尽管 Seedance 2.5 和 Flux 3 在原始画质上各有千秋,但 Flux 3 在整体逻辑和智能化体验上感觉更胜一筹。
  • 作者 @beechinour 认为,Seedance 2.5 在专业用途上依然保持领先,而 Flux 3 则在复古影像创作(如伪造记忆、遗失录像、VHS 画面等)这一全新赛道中胜出。
  • 作者 @LudovicCreator 的动态设计测试认为 MiniMax H3 表现最为出色。

第 9 集 · Together AI 推出 FLUX 3 无服务器 API(2026-08-07,2 条)

Together AI 宣布其 Serverless 推理平台正式上线 Black Forest Labs 的新一代多模态视频生成模型 FLUX 3,为开发者提供生产级部署方案。该模型能力强大,能够在单次生成中处理多场景与运镜,并支持多语言对话、唇形同步以及环境音,实现原生音视频同步生成。

第 10 集 · Black Forest Labs发布FLUX 3多模态模型(2026-08-11,2 条)

Black Forest Labs 正式发布全新多模态模型 FLUX 3 Video。该模型将图像、视频、音频生成以及机器人动作预测统一在单一模型中。其核心能力包括支持输出长达 20 秒的高清视频片段,并内置了原生音频生成能力。这一发布标志着多模态生成技术在融合多种内容形态方面取得了新进展。

第 11 集 · FLUX 3 Video登顶全球第二,限时免费开放(2026-08-12,5 条)

Black Forest Labs(BFL)的视频生成模型 FLUX 3 Video 更新版在 LMSYS Arena 文生视频排行榜中位列第二,得分 1496,仅比榜首 Gemini Omni Flash 低 16 分。为庆祝这一成绩,官方在 Playground 限时免费开放该模型,截止太平洋时间 16 日晚间。该模型支持原生音频、文生视频和图生视频(多帧)等功能。

已确认

  • 榜单成绩:FLUX 3 Video 更新版在 LMSYS Arena 文生视频赛道获得 1496 分,位列全球第二,仅落后榜首的闭源模型 Gemini Omni Flash(1512 分)16 分。
  • 功能支持:该模型支持原生音频、文生视频以及图生视频(多帧)等功能。
  • 免费体验:官方在旗下 Playground 中限时免费开放了 FLUX 3 Video 的使用,截止时间为太平洋时间 16 日晚间(周日)。

为什么重要

  • 开源追赶闭源:作为 BFL 旗下的重要产品,FLUX 3 Video 在竞技场基准测试中取得了极其靠前的名次,展现了开源(或半开源)视频模型在性能上紧逼顶尖闭源模型的实力。

第 12 集 · Flux 3文生视频实测:真实感与运镜表现惊艳(2026-08-12,2 条)

近期,创作者们对Black Forest Labs推出的Flux 3文生视频模型进行了初步实测,结果令人惊叹。测试表明,该模型在画面真实感、物体纹理细节、环境呈现以及情感表达和整体构图上均展现出极高水准。此外,Flux 3对镜头运动的指令遵循能力同样表现优异,其出色的运镜效果进一步彰显了该模型在视频生成领域的强大实力。

第 13 集 · FLUX 3 Video空降图生视频榜单第五(2026-08-13,2 条)

LMArena最新更新的图生视频排行榜显示,由Black Forest Labs发布的FLUX 3 Video模型以1453分的成绩空降榜单第五名。该模型在图生视频领域展现出了强劲的技术实力与竞争力。目前,排在其前面的模型包括MiniMax等头部产品,其中MiniMax占据榜首位置,反映出当前视频生成赛道竞争的日益白热化。