FLUX 3 把图像视频音频和动作预测统一进一个模型
robrombach · x · 2026-07-24
FLUX 3 把图像、视频、音频和动作预测做进同一模型
Black Forest Labs 发布 FLUX 3,称其是一个统一的多模态架构,覆盖 图像、视频、音频和动作预测。官方强调,新模型在不同风格下生成结果更接近真实世界;其中 FLUX 3 Video 已进入 early access。
更值得注意的是,官方表示它是在同一统一架构中联合训练的,并且可以进一步扩展到 机器人动作预测。线程还提到,这一路线与 mimic 和 Audi 的合作相关。
「具身」频道最新
- 宇树 As2-W 四足机器人亮相攀岩演示 — blaawker · 2026-07-24
- 中国测试会自动布防事故现场的机器人交通锥 — lukas_m_ziegler · 2026-07-24
- 机器人 VLA 推理暴露延迟与 action chunk 的权衡 — SoyGema · 2026-07-24
- Uber 创始人劝退传统软件:去给重型机械做 AI 改造 — Portable_Solar_ZA · 2026-07-24
- TIME 新封面聚焦 Unitree:人形机器人浪潮正在加速 — chris_j_paxton · 2026-07-24
- Hugging Face:模型做得到侦察,却还缺关键推理跃迁 — AI Engineer · 2026-07-24