Black Forest Labs 称 FLUX 3 超越多款多模态对手并走向机器人
Latent Space · rss · 2026-07-24
这期 Latent Space AI News 的重点之一是 Black Forest Labs 的 FLUX 3 多模态模型发布。
- 文中把 FLUX 3 描述为一个统一的多模态系统,覆盖图像、视频、音频和动作预测。
- 作者称它在对比中超过了 Seedance 2.0、Gemini Omni 和 Grok Imagine 等系统。
- BFL 公布的能力包括:text-to-video、image-to-video、video-to-video、音视频续写、关键帧控制生成、多语言对话、长镜头链式生成、风格多样性和文字排版生成等。
- 文章还提到 FLUX-mimic:这是一个基于 FLUX 3 的机器人视频-动作模型,与 mimic robotics 合作,用机器人和可穿戴数据训练,目标是提升灵巧操作与控制效率。
- 整体观点是:更强的视频世界模型,可能会直接迁移到机器人控制能力和样本效率上。
「具身」频道最新
- Mistral 的 8B 导航模型只用单目 RGB,R2R-CE 达 77.4% — mistralai · 2026-07-24
- REK 在东京对战夜前放出武士机器人热身视频 — cixliv · 2026-07-24
- SAGE 生成可仿真 3D 场景并开源 1 万条具身数据集 — rsasaki0109 · 2026-07-24
- 清华团队用 AutoMIA 把两张图变成可 3D 打印的镜像错觉艺术 — 新智元 · 2026-07-24
- ReferTrack 用单摄像头跟踪自然语言目标,EVT-Bench 达到 89.4% — tencent · 2026-07-24
- IGGT4D 把流式 4D 实例几何带进动态场景理解 — zhenjun_zhao · 2026-07-24