Black Forest Labs 发布 FLUX 3:图/视频/音频三模态统一模型
bfl_ai · x · 2026-08-05
Black Forest Labs 正式发布 FLUX 3 预览版,这是一个在图像、视频和音频上统一训练的多模态模型。其核心亮点是能够通过单一请求(同一 endpoint)生成带有同步音频的视频。
核心功能与规格
- 视频与音频同步:在生成画面的同时,直接合成多语言语音(具备强大的唇形同步)、音效与环境音。
- 高清长视频:单次请求可生成最长 20 秒的 FHD(1920×1088)分辨率、24fps 视频。
- 多场景与排版:支持在单次生成中包含多个场景和摄像机角度,且能在场景内准确渲染文字排版。风格超越传统电影感,支持动画和动态设计。
支持模式
所有请求均通过 flux-3-video 端点处理,主要通过 mode 参数区分三种生成模式:
- Text to Video (t2v):纯文本提示词生成视频。
- Image to Video (i2v):基于输入图像作为帧来生成视频。
- Video Continuation (v2v):基于已有视频片段继续向后延展生成。
官方表示,后续将很快推出视频编辑功能以及支持图像和视频的 Omni Reference 功能。
所属事件:Black Forest Labs 发布 FLUX 3 多模态模型(11 条相关)→
「多模态」频道最新
- Karpathy 实测 Claude Opus:2小时写5500行代码渲染3D世界 — jon_barron · 2026-08-05
- 图像模型比视频模型更有趣?从业者指行业因利润转向视频 — mark_k · 2026-08-05
- ComfyUI 新节点:一键生成 PBR 材质并同步至 Blender — Scared-Sandwich1283 · 2026-08-05
- AI 生成科幻短片《Space EP 1: Making Contact》 — Ermajean12 · 2026-08-05
- 如何打造逼真AI虚拟角色:图像生成一致性工作流探讨 — GooDroop · 2026-08-05
- 开发者用 GPT-5.6 结合 Three.js 打造 3D 海岸灯塔 — techartist_ · 2026-08-05