H3-World:8 千条游戏数据让视频模型变成可控世界模拟器
sachasayan · reddit · 2026-09-02
研究者发布 H3-World,把 MiniMax H3 的文本理解变成「世界控制」:
- 语言原生控制:将角色与相机动作组合为文本指令,通过 H3 预训练的文本通路注入,无需新控制分支。
- 时间对齐:每个视频 latent 区间绑定一个动作 prompt,实现动作随时间变化时的精确控制。
- 高效:仅用 8,000 条游戏画面样本、10,000 步 LoRA 训练、0.199% 可训练参数,即可控制角色与相机运动,并能泛化到未见过的动作组合和视觉场景。
论文、代码、模型与项目页均已公开(arXiv 2609.01560),属于视频生成模型向交互式世界模型的低成本改造尝试。
所属事件:MiniMax 发布 H3-World:用 8K 样本把视频模型变成可控世界模拟器(5 条相关)→
「多模态」频道最新
- AI 生成短片《守护者苏醒》,媒体生成效果引关注 — AIFilmLabsPage · 2026-09-02
- AI 生成多人齐舞 MV:角色、编舞、运镜一体的完整工作流 — aftahi_ai · 2026-09-02
- Seedance 2 生成速降山地车极限视频,动作流畅度惊艳 — Ok-Nerve941 · 2026-09-02
- 用 Seedance 2.5 与 APOB AI 批量生产 AI 网红短视频 — aftahi_ai · 2026-09-02
- Photoshop Beta 更新:蒙版局部重绘与参考图编辑受创作者好评 — jnack · 2026-09-02
- AI 生成梦幻短片《夢の世界》,超现实画面引围观 — Zhixian1209 · 2026-09-02