用 DiffusionNFT 跑通 MiniMax-H3 音视频联合生成 RL 训练闭环
青稞AI · wechat · 2026-09-08
VeRL-Omni 团队发布实践记录:基于 DiffusionNFT 算法,在 VeRL-Omni 框架中跑通 MiniMax-H3 的 T2VA(文本到音视频)与 FL2VA(首尾帧到音视频)在线 RL 训练闭环。
- MiniMax-H3 是开源音视频联合生成模型,输出原生立体声视频(最长15秒、2K、24FPS),Text-to-Video Arena Elo 1227 位列前三且是榜前列唯一开放权重模型。
- 架构分工:vLLM-Omni 负责 rollout 生成,Diffusers/FSDP2 负责 actor 训练,VeRL-Omni 串联数据、reward、DiffusionNFT loss 与 LoRA old-policy 同步。
- Reward 用 CLAP(文本-音频对齐)+ ImageBind(音画一致性)双指标加权,避免单一指标留下优化空隙。
- 关键坑:H3 为 CFG-distilled、timestep 用 data fraction、velocity 符号反向等设计,接入训练框架时容易静默出错——链路任何一环错了训练曲线照样上升,因此重点在逐环节验证。
- 结果:8 GPU 验证 checkpoint 的 core reward mean 0.41,训练 3+ 步升至 0.51,gradnorm 稳定在 0.06–0.12,文末给出完整可复现配置表。
「多模态」频道最新
- 只靠一段提示词,创作者用 MiniMax H3 做出 2D 日系电音动漫 MV — Hailuo_AI · 2026-09-11
- 街景变 V2V:用 GPT Astra 取图、MiniMax H3 转车载视角实现「全球自驾」 — Hailuo_AI · 2026-09-11
- 单作者ECCV 2026论文:让卷帘快门失真修正实用化 — ducha_aiki · 2026-09-11
- AI 数字人翻唱《东爱》以假乱真,冷艳主播惊呆网友 — JourneymanChina · 2026-09-11
- ComfyUI 风格浏览器更新:LoRA 预览目录与分享功能 — neonsparksuk · 2026-09-11
- 博主分享 4 个 Midjourney V6 最爱风格码 --sref 直接可用 — michaelrabone · 2026-09-11