专题 · FULL STORY
FLUX 3多模态模型:从发布到实测霸榜
Black Forest Labs发布FLUX 3多模态模型,统一图像、视频、音频与动作预测。模型发布后引发实测热潮,并在LMArena等榜单中名列前茅,展现出惊艳的真实感与运镜能力。
2026-07-22 ~ 2026-08-14 · 13 集 · 100 条
第 1 集 · Black Forest Labs 发布 FLUX 3:迈向全模态与具身智能底座(2026-07-22,28 条)
Black Forest Labs 正式发布 FLUX 3 模型,将其定位为迈向多模态 flow 模型的重要一步与视觉智能的基础架构。该模型采用统一架构,全面覆盖图像、视频、音频以及动作预测能力,标志着生成式 AI 正加速向具备“世界理解”能力的全模态底座演进。
已确认
- 多模态与视频能力:FLUX 3 确认覆盖图像、视频、音频和动作生成。FLUX 3 Video 采用统一的图像/视频/音频架构,单次最长可生成 20 秒视频。该模型支持文生视频、图生视频、参考视频生成、音视频延长、关键帧控制、多语言对话以及智能多镜头剪辑等。
- 开放节奏:FLUX 3 Video 已进入 early access 阶段并即将开源;视频原生音频生成同样进入早期测试。官方计划在未来几周到几个月内陆续开放图像编辑和开权重底座,动作预测则将通过部分科研和商业伙伴逐步开放。
- 机器人部署:FLUX 3 的早期版本已在机器人上运行,并在机器人任务中表现出优于 REPA 的性能。mimic robotics 是首批早期访问合作伙伴之一,双方共同开发了 FLUX-mimic 模型;此外 Audi 也参与了相关部署。
- 图像生成:官方已放出 FLUX 3 Image 的早期样张,展示了其在微距写实、平面插画和产品海报等多种风格上的成熟表现。
为什么重要
FLUX 3 的发布标志着生成模型不再局限于数字内容创作。特别是其动作预测能力的引入,以及在实际机器人(如 mimic robotics 和 Audi 项目)上的早期部署,展现了生成模型在物理世界交互和具身智能方向的巨大潜力,提出了“Real World Models”的全新概念。
- Flux 3 被预告为图文视频音频一体模型 — rerri · 2026-07-22
- Flux 3 被曝将覆盖图像视频音频与动作生成 — Angaisb_ · 2026-07-22
- Black Forest Labs 传出 Flux 3:图像视频音频动作一体 — ZeroStateReflex · 2026-07-23
- 黑森林工作室疑似预告 FLUX 3, 主打全模态生成 — op7418 · 2026-07-23
- Black Forest Labs 推出 FLUX 3,覆盖图像视频音频与动作预测 — bfl_ai · 2026-07-23
- FLUX 3 将陆续开放原生音频、图像编辑和开权重底座 — bfl_ai · 2026-07-23
- FLUX 3 已通过 mimic 和 Audi 部署跑上机器人 — bfl_ai · 2026-07-23
- Black Forest Labs 放出 FLUX 3 Image 早期样张 — bfl_ai · 2026-07-23
- Black Forest Labs 将 FLUX 3 定位为视觉智能的多模态底座 — stephen370 · 2026-07-23
- FLUX 3 被描述为面向多模态生成的 Self-Flow 系统 — hila_chefer · 2026-07-23
- Black Forest Labs 推出 FLUX-3:统一图像、视频与音频架构 — nathanbenaich · 2026-07-23
- FLUX 3 提出 Real World Models,主打多模态视觉智能 — MoistRecognition69 · 2026-07-23
- FLUX 3 被称在机器人任务上超过 REPA — hila_chefer · 2026-07-23
- 黑森林工作室称 Flux 3 视频模型开源,支持全模态生成 — op7418 · 2026-07-23
- BlackForestLabs 发布并即将开源 FLUX 3 视频生成模型 — 歸藏的AI工具箱 · 2026-07-23
- Black Forest Labs 发布覆盖图像视频音频的 FLUX 3 — chrisfirst · 2026-07-23
- Black Forest Labs 发布 FLUX 3:统一多模态覆盖图像视频音频 — daniel_mac8 · 2026-07-24
- Flux 3 被定位为图像视频推理一体多模态模型 — mark_k · 2026-07-24
- FLUX 3 把图像、视频、音频和动作预测合到一个模型里 — GabGarrett · 2026-07-24
- Stable Diffusion 公布 FLUX 3,兼具图像视频与原生音频生成 — imjustnewatai · 2026-07-24
第 2 集 · Black Forest Labs FLUX.3 开启早期测试,迈向全模态生成(2026-07-23,11 条)
Black Forest Labs(黑森林工作室)新一代模型 FLUX.3 已向部分用户开放早期测试,并放出了展示视频。首批测试者分享了惊艳的生成样张,传闻指出该模型将从单一图像生成转型为全模态骨干模型,覆盖视频、音频及机器人动作预测。
已确认
模型 FLUX.3 确实存在,官方已放出早期访问展示视频。部分测试者(如 @ostrisai)已获得体验权限并连续试玩数天,分享了大量生成结果,且提到开启了音频。此外还有疑似 Flux 3 或 Flux Video 的最新图像样本被分享出来。测试反馈显示该模型在画质与风格化生成上表现优异,@Eric520CC 认为其足以在开源图像模型领域再掀一次洗牌。
尚未确认
目前关于模型的具体多模态能力(如最长 20 秒视频、音频、机器人动作生成及推理能力)均来自爆料与预热信息。@multimodalart 指出 FLUX.3 [dev] 被描述为开放权重的多模态骨干模型,@eyishazyer 也推测其大概率会开放或开源权重,但官方尚未正式发布完整的技术规格与开源协议。
为什么重要
如果传闻属实,FLUX.3 将成为一款覆盖图像、视频、音频和动作预测的全面型多模态模型。这标志着顶级开源图像模型正式向更广阔的多模态生成与物理世界交互(机器人动作)领域迈进,对 AI 内容创作及具身智能领域具有重要意义。
- Flux 3 传闻加入图像、20 秒视频和推理 — mark_k · 2026-07-23
- FLUX 3 预热视频曝光,疑似支持 20 秒多模态生成 — eyishazyer · 2026-07-23
- FLUX 3 模型早期测试展示放出 — MFGREBEL · 2026-07-23
- Black Forest Labs 预热开放权重多模态骨干 FLUX.3 — multimodalart · 2026-07-24
- Black Forest Labs 新一代图像模型 FLUX 3 开启测试 — AIandDesign · 2026-07-24
- Flux 3/Flux Video 曝光最新图像样本 — koltregaskes · 2026-07-24
- @AIandDesign 发帖称 FLUX 3 回来了 — AIandDesign · 2026-07-24
- FLUX 3 动效图展示开源图像模型新高度 — Eric520CC · 2026-07-24
- FLUX 3 画质被认为足以再掀一次开源洗牌 — Eric520CC · 2026-07-24
- Black Forest Labs 的 FLUX 3 进入早期测试 — ostrisai · 2026-07-24
- FLUX 3 早期生成样张展示 Black Forest Labs 新图像模型 — ostrisai · 2026-07-24
第 3 集 · BFL 发布 FLUX 3:统一多模态底座切入视频与机器人(2026-07-24,12 条)
Black Forest Labs(BFL)正式发布 FLUX 3,这是一个统一的多模态底座,将图像、视频、原生音频和动作预测(Action Prediction)整合在同一个模型架构中。目前 FLUX 3 Video 已进入早期体验阶段,团队计划在未来几周到几个月内分批通过 API 和私有权重开放各项能力。该模型因展现出对物理世界的深刻理解,被业界视为迈向通用世界模拟器和机器人控制的重要节点。
已确认
FLUX 3 采用统一架构,能够同时处理图像、视频、音频和动作预测。官方强调新模型在不同风格下的生成结果更贴近真实物理感,其原生音频能力在实测反馈中获得好评。模型能力将通过 API 和私有权重逐步提供,目前 FLUX 3 Video 正处于收集反馈与安全测试的 Early Access 阶段。
尚未确认
关于 FLUX 3 是否会推出单独的“Klein”模型版本,目前官方信息表明 FLUX 3 更像是一组能力集合,而非单一独立模型。此外,用户指出目前决定该模型能否真正落地生产环境的关键指标(如具体延迟、并发限制和价格体系)仍未公开。
为什么重要
FLUX 3 的核心突破在于其动作预测能力。多位分析者(如 @MattVidPro、@rohanpaulai)指出,不同于仅依赖少量遥操作数据的传统 VLA 模型,FLUX 3 吸收了大规模视频预训练数据,从而更好地掌握了接触、形变和时间因果等物理规律。@imjustnewatai 等作者进一步认为,FLUX 3 将视频模型与机器人控制结合,印证了从视频生成走向世界模型、最终落地具身智能的技术演进路线。
- FLUX 3 被指示意 OpenAI 路线:视频模型走向个人机器人 — imjustnewatai · 2026-07-24
- 一条线程整理 FLUX 3、Sora 2 与 OpenAI 机器人证据 — imjustnewatai · 2026-07-24
- FLUX 3 把图像视频音频和动作预测统一进一个模型 — robrombach · 2026-07-24
- FLUX 3 Video 开放早期体验,但生产化关键数据仍缺失 — MembershipEmergency7 · 2026-07-24
- BFL 发布 FLUX 3:统一图像、视频、音频与动作预测模型 — umesh_ai · 2026-07-24
- FLUX 3 把图像、视频、音频和动作预测合成一体 — Eric520CC · 2026-07-24
- Flux 3 更像一组能力,不是单独的 Klein 模型 — carrot_2333 · 2026-07-24
- FLUX 3 发布多模态底座,统一覆盖图像视频音频与动作预测 — pmttyji · 2026-07-24
- FLUX 3 把图像视频音频和动作预测做进一个模型 — robrombach · 2026-07-24
- Black Forest Labs 发布 FLUX 3,覆盖图像视频音频 — 3scorciav · 2026-07-24
- FLUX 3 用视频预训练切入机器人学习 — rohanpaul_ai · 2026-07-25
- FLUX 3 试图成为开源版 Sora 2,覆盖视频音频机器人 — MattVidPro · 2026-07-25
第 4 集 · Black Forest Labs传将发布FLUX 3模型(2026-07-26,2 条)
传闻Black Forest Labs即将发布新一代生成模型FLUX 3。据爆料,该模型不仅会在多模态理解和图像生成质量上带来显著提升,更计划将图像、视频、音频和动作预测统一整合进同一模型中。这一升级引发了社区的广泛关注。
- 爆料:Black Forest Labs 即将发布 FLUX 3 模型 — gandamu_ml · 2026-07-26
- 传闻称 Flux 3 统一图像视频音频与动作预测 — theteknosaur · 2026-07-26
第 5 集 · Black Forest Labs 推出 FLUX 3 支持原生音频视频生成(2026-07-28,2 条)
Black Forest Labs 宣布推出 FLUX 3 模型,目前进入限量开放阶段。作为多模态创作工具的重大升级,该模型不仅能生成图像,还支持生成最长 20 秒的视频,并具备原生音频输出能力,实现了音视频与图像的一体化生成。
- Black Forest Labs 推出可生 20 秒带音频视频的 FLUX 3 — emmanuelvivier · 2026-07-28
- Black Forest Labs 推出 FLUX 3,可生成 20 秒原生音频视频 — emmanuelvivier · 2026-07-28
第 6 集 · Black Forest Labs发布FLUX 3多模态模型,支持原生音频视频生成(2026-08-04,19 条)
Black Forest Labs正式发布FLUX 3预览版,这是一个在图像、视频和音频上统一训练的多模态大模型。其核心亮点是能够通过单一请求生成带有同步原生音频的高清视频,单次最长可达20秒,标志着官方在构建真实“世界模型”道路上迈出重要一步。目前模型已进入早期体验阶段,API与网页端均已开放使用。
已确认
- FLUX 3支持文生视频、图生视频(可设置首尾帧或多关键帧)、视频续写以及多语言对话功能。
- 视频生成提供720p和1080p分辨率选项,单次最长20秒,并配备原生音频(含音效、环境音),同时提供低成本的Draft(草稿)模式。
- 模型采用统一架构联合训练,能够在单次生成中切换场景与镜头角度,未来还将推出基于参考图的生成变体。
- FLUX 3现已通过API向公众开放,并上线Runware以及图像处理平台Magnific,提供一站式生成与放大工作流。
- 网页端已开放,用户可登录官网购买点数直接生成视频,目前仅上线视频生成功能,图像生成等其他功能后续推出。
- 模型已上线Cloudflare AI Gateway,支持文生视频、图生视频和视频续写。
- 官方宣布即将开放模型权重,API已向Replicate、Krea、Fal等合作平台开放。
尚未确认
- 具体开放模型权重的时间表尚未公布。
- 关于模型参数规模、训练数据等细节未披露。
为什么重要
- 官方认为,单一模态只能捕捉现实的投影,而多模态联合学习能通过相互约束(如声音匹配撞击、运动遵循质量)更好地理解物理世界的底层规律。FLUX 3的发布不仅是视频生成能力的提升,更是向构建真实“世界模型”技术愿景迈进的关键尝试。
- Black Forest Labs 推出 FLUX 3:统一图像、视频与音频的多模态大模型 — dl_weekly · 2026-08-04
- Flux 3 视频模型上线 Runware API,支持 1080p 20 秒生成 — aziz4ai · 2026-08-04
- Black Forest Labs 发布 FLUX 3 视频模型,支持原生音频与 1080p — bfl_ai · 2026-08-05
- Black Forest Labs 发布 FLUX 3:图/视频/音频三模态统一模型 — bfl_ai · 2026-08-05
- Black Forest Labs发布FLUX 3 Video多模态模型 — robrombach · 2026-08-05
- FLUX 3 Video技术解析:主打多模态原生对齐与长视频生成 — robrombach · 2026-08-05
- FLUX 3技术愿景:统一架构学习图像视频音频,构建真实世界模型 — robrombach · 2026-08-05
- Black Forest Labs FLUX 3 视频模型上线 Magnific,提供一站式生成与放大工作流 — LudovicCreator · 2026-08-05
- Black Forest Labs发布FLUX 3:统一图像、视频与音频的多模态模型 — pess_r · 2026-08-05
- FLUX 3 视频生成功能上线,开放网页端购买使用 — mark_k · 2026-08-05
- BFL 发布 FLUX 3 视频模型:支持原生音频与多语言对话 — iamrobotbear · 2026-08-05
- Black Forest Labs 首个视频模型 FLUX 3 发布 — aziz4ai · 2026-08-05
- FLUX 3 视频模型发布:支持原生音频与最高 20 秒 1080p — iamaliveix · 2026-08-05
- Runway发布FLUX 3:可生成和编辑长达20秒带音频视频 — aziz4ai · 2026-08-05
- Flux 3 视频模型即将开放 API,支持多平台调用 — Lucaspittol · 2026-08-05
- Flux 3 Video 宣布即将开放权重,API 已全面可用 — Lucaspittol · 2026-08-05
- Black Forest Labs FLUX 3 视频模型上线 Cloudflare AI 网关 — craigsdennis · 2026-08-05
- BFL 发布 FLUX 3 视频模型:支持原生音频与 1080P — MicahBerkley · 2026-08-05
- BFL 发布 FLUX 3 视频模型,官方承诺将推出开源权重版 — cloneofsimo · 2026-08-05
第 7 集 · Black Forest Labs发布FLUX 3视频模型引热议(2026-08-06,3 条)
Black Forest Labs 推出的 FLUX 3 视频生成模型在公开后迅速引发社区轰动。该模型展现出强大的提示词遵循与渲染能力,不仅能生成连贯的打斗场景和字幕卡,还原生内嵌了音频。用户基于其逼真的效果创作了大量极具创意的视频,包括伪造记忆与电影级预告片等复杂细节场景,充分展示了其在视频生成领域的突破。
- FLUX 3 视频模型惊艳实测:伪造记忆与电影级预告片 — minchoi · 2026-08-06
- FLUX 3首发爆火,X平台涌现七大离谱生成案例 — heypearlai · 2026-08-06
- FLUX 3 展示强大视频生成能力:原生音频与复杂细节 — heypearlai · 2026-08-06
第 8 集 · Flux 3 发布引实测热潮,多模型横评竞争激烈(2026-08-06,10 条)
Black Forest Labs 发布开源视频生成模型 Flux 3,支持单次生成 20 秒带同步原生音频的片段,并能生成片名与完整动作戏。该发布迅速引发社区实测热潮,多位创作者将其与 Seedance、MiniMax H3 等主流模型进行横评。目前结论显示,Flux 3 在运镜、物理破坏效果及复古影像创作上优势明显,但在整体能力排名上仍存争议,竞品在专业应用、细节处理和综合表现上各有千秋。
已确认
- Flux 3 由 Black Forest Labs 开发并开源,支持单次生成 20 秒带同步音频片段,并能生成片名与完整动作戏。
- Seedance(字节跳动)版本涵盖 2.0 至 2.5,最长支持 30 秒生成与 50 个参考输入。
- MiniMax H3 在细节、灯光和时序同步上处理最佳。
尚未确认
- 模型间的绝对实力排名仍无定论。作者 @flowersslop 通过“霸王龙对战大象”提示词测试后认为,Flux 3 虽优于多数模型,但仍不敌数月前发布的 Seedance 2,给出的综合排名为 Seedance 2.5 领先,Flux 3 位居第二。
为什么重要
- 本次实测横评直观展示了当前主流视频生成模型的核心差异与激烈竞争。作者 @eyishazyer 指出 Flux 3 在空中运镜、真实物理破坏效果、车门开合等复杂转场以及手部动作同步上表现极佳且稳定。相比之下,Seedance 2.5 在动作流畅度上略显滞后,Seedance 2.0 顶配表现也稍逊一筹。
- 作者 @heypearlai 的多场景测试验证了 Flux 3 在一镜到底穿梭房间和高难度动作场景中的连贯性与细节处理能力。
- 作者 @gorkem 在对比后表示,尽管 Seedance 2.5 和 Flux 3 在原始画质上各有千秋,但 Flux 3 在整体逻辑和智能化体验上感觉更胜一筹。
- 作者 @beechinour 认为,Seedance 2.5 在专业用途上依然保持领先,而 Flux 3 则在复古影像创作(如伪造记忆、遗失录像、VHS 画面等)这一全新赛道中胜出。
- 作者 @LudovicCreator 的动态设计测试认为 MiniMax H3 表现最为出色。
- Flux 3 横空出世,四大视频生成模型实测横评 — eyishazyer · 2026-08-06
- Flux 3 视频生成实测:动作连贯与场景切换优于 Seedance — eyishazyer · 2026-08-06
- Flux 3 实测:运镜与物理效果碾压 Seedance 2.0 — eyishazyer · 2026-08-06
- 四大视频模型参数对比:Flux 3、Seedance、MiniMax 与 Grok — eyishazyer · 2026-08-06
- Flux 3 对决 Seedance 与 MiniMax H3:视频生成实测 — eyishazyer · 2026-08-06
- FLUX 3 视频生成实测:原生音效与运镜细节拉满 — heypearlai · 2026-08-06
- 视频生成横评:Flux 3 对决 MiniMax H3 与 Seedance 2.5 — LudovicCreator · 2026-08-07
- 实测对比:FLUX.3 视频生成在逻辑与整体表现上优于 Seedance 2.5 — gorkem · 2026-08-08
- Seedance 2.5 占据专业领域,FLUX 3 开辟复古影像创作新赛道 — beechinour · 2026-08-08
- 视频生成实测:Seedance 2 依然领先,Flux 3 位居第二 — flowersslop · 2026-08-08
第 9 集 · Together AI 推出 FLUX 3 无服务器 API(2026-08-07,2 条)
Together AI 宣布其 Serverless 推理平台正式上线 Black Forest Labs 的新一代多模态视频生成模型 FLUX 3,为开发者提供生产级部署方案。该模型能力强大,能够在单次生成中处理多场景与运镜,并支持多语言对话、唇形同步以及环境音,实现原生音视频同步生成。
- Together AI 推出 FLUX 3 无服务器 API,支持原生音频与多场景生成 — togethercompute · 2026-08-07
- Together AI 上线 FLUX 3:单次生成多场景,支持音视频同步 — togethercompute · 2026-08-07
第 10 集 · Black Forest Labs发布FLUX 3多模态模型(2026-08-11,2 条)
Black Forest Labs 正式发布全新多模态模型 FLUX 3 Video。该模型将图像、视频、音频生成以及机器人动作预测统一在单一模型中。其核心能力包括支持输出长达 20 秒的高清视频片段,并内置了原生音频生成能力。这一发布标志着多模态生成技术在融合多种内容形态方面取得了新进展。
- FLUX 3 Video 发布:原生音频与 20 秒高清片段生成 — thione · 2026-08-11
- Black Forest Labs 发布 FLUX 3:统一图像、视频、音频与机器人动作预测 — bennash · 2026-08-12
第 11 集 · FLUX 3 Video登顶全球第二,限时免费开放(2026-08-12,5 条)
Black Forest Labs(BFL)的视频生成模型 FLUX 3 Video 更新版在 LMSYS Arena 文生视频排行榜中位列第二,得分 1496,仅比榜首 Gemini Omni Flash 低 16 分。为庆祝这一成绩,官方在 Playground 限时免费开放该模型,截止太平洋时间 16 日晚间。该模型支持原生音频、文生视频和图生视频(多帧)等功能。
已确认
- 榜单成绩:FLUX 3 Video 更新版在 LMSYS Arena 文生视频赛道获得 1496 分,位列全球第二,仅落后榜首的闭源模型 Gemini Omni Flash(1512 分)16 分。
- 功能支持:该模型支持原生音频、文生视频以及图生视频(多帧)等功能。
- 免费体验:官方在旗下 Playground 中限时免费开放了 FLUX 3 Video 的使用,截止时间为太平洋时间 16 日晚间(周日)。
为什么重要
- 开源追赶闭源:作为 BFL 旗下的重要产品,FLUX 3 Video 在竞技场基准测试中取得了极其靠前的名次,展现了开源(或半开源)视频模型在性能上紧逼顶尖闭源模型的实力。
- FLUX 3 Video更新版登顶LMSYS文生视频榜第二,仅差榜首16分 — bfl_ai · 2026-08-12
- FLUX 3 Video登顶全球第二,限时开放免费体验 — arena · 2026-08-12
- Flux 3 视频模型更新测试,紧追闭源领跑者 — Lucaspittol · 2026-08-12
- FLUX 3 Video视频生成模型升至全球第二,限时免费开放 — robrombach · 2026-08-12
- FLUX 3 视频模型冲上 Arena 第二,仅落后 Gemini 16 分 — arena · 2026-08-12
第 12 集 · Flux 3文生视频实测:真实感与运镜表现惊艳(2026-08-12,2 条)
近期,创作者们对Black Forest Labs推出的Flux 3文生视频模型进行了初步实测,结果令人惊叹。测试表明,该模型在画面真实感、物体纹理细节、环境呈现以及情感表达和整体构图上均展现出极高水准。此外,Flux 3对镜头运动的指令遵循能力同样表现优异,其出色的运镜效果进一步彰显了该模型在视频生成领域的强大实力。
- FLUX 3 视频生成实测:逼真环境与情感构图令人惊叹 — CurieuxExplorer · 2026-08-12
- Flux 3 文生视频实测:真实感与运镜表现惊艳 — gen_ericai · 2026-08-14
第 13 集 · FLUX 3 Video空降图生视频榜单第五(2026-08-13,2 条)
LMArena最新更新的图生视频排行榜显示,由Black Forest Labs发布的FLUX 3 Video模型以1453分的成绩空降榜单第五名。该模型在图生视频领域展现出了强劲的技术实力与竞争力。目前,排在其前面的模型包括MiniMax等头部产品,其中MiniMax占据榜首位置,反映出当前视频生成赛道竞争的日益白热化。
- FLUX 3 Video 登上图生视频榜单第五名,得分 1453 — arena · 2026-08-13
- FLUX 3 Video空降图生视频榜单第五,MiniMax登顶 — arena · 2026-08-13