Black Forest Labs 推出 Flux 3,支持最长 20 秒原生音频视频生成
The Decoder · rss · 2026-07-24
Black Forest Labs 发布了 Flux 3,这是一款同时学习图像、视频和音频的多模态基础模型。
它最重要的能力是原生生成带声音的视频,最长可到 20 秒。公司自测结果称它略优于 Seedance 2.0,但目前还没有独立基准验证。BFL 还表示,最终目标是做世界模型,并且已经把 Flux 3 用到机器人任务测试中。
「具身」频道最新
- 生产级 AI agent 不只要会干活,还要会安全协作 — MaryamMiradi · 2026-07-24
- 软体机器人驱动技术演示:气动结构形变 — IanPritchard · 2026-07-24
- 连续体机器人潜力被低估:有望革新抓取与平衡 — IanPritchard · 2026-07-24
- Cosmic Robotics 加入 YC 批次,做自主建筑机器人 — ycombinator · 2026-07-24
- 一条热帖称,多数人形机器人演示仍靠脚本或远程操控 — TansuYegen · 2026-07-24
- 前 Uber 创始人:自动驾驶将大幅提升矿业开采效率 — edgarpavlovsky · 2026-07-24