BFL 发布 FLUX 3:统一多模态底座切入视频与机器人

Black Forest Labs(BFL)正式发布 FLUX 3,这是一个统一的多模态底座,将图像、视频、原生音频和动作预测(Action Prediction)整合在同一个模型架构中。目前 FLUX 3 Video 已进入早期体验阶段,团队计划在未来几周到几个月内分批通过 API 和私有权重开放各项能力。该模型因展现出对物理世界的深刻理解,被业界视为迈向通用世界模拟器和机器人控制的重要节点。

已确认

FLUX 3 采用统一架构,能够同时处理图像、视频、音频和动作预测。官方强调新模型在不同风格下的生成结果更贴近真实物理感,其原生音频能力在实测反馈中获得好评。模型能力将通过 API 和私有权重逐步提供,目前 FLUX 3 Video 正处于收集反馈与安全测试的 Early Access 阶段。

尚未确认

关于 FLUX 3 是否会推出单独的“Klein”模型版本,目前官方信息表明 FLUX 3 更像是一组能力集合,而非单一独立模型。此外,用户指出目前决定该模型能否真正落地生产环境的关键指标(如具体延迟、并发限制和价格体系)仍未公开。

为什么重要

FLUX 3 的核心突破在于其动作预测能力。多位分析者(如 @MattVidPro、@rohanpaulai)指出,不同于仅依赖少量遥操作数据的传统 VLA 模型,FLUX 3 吸收了大规模视频预训练数据,从而更好地掌握了接触、形变和时间因果等物理规律。@imjustnewatai 等作者进一步认为,FLUX 3 将视频模型与机器人控制结合,印证了从视频生成走向世界模型、最终落地具身智能的技术演进路线。

2026-07-24 ~ 2026-07-25 · 12 条相关

事件全程(共 13 集)→

一手来源

另有 3 条近重复转述:umesh_ai · Eric520CC · 3scorciav