H3-World: 复用视频生成器语义实现世界控制
Danze Chen · hf · 2026-09-02
H3-World 框架将 MiniMax-H3 视频生成器转化为交互式世界模型。研究发现在大规模视频生成中,语言正成为控制的自然接口。H3-World 通过结构化指令和时序注意力路由,在极少参数调整下实现精准的角色和相机控制,直接复用预训练语义表示。
「多模态」频道最新
- Runway发布界面世界模型Solaris,实时生成可交互界面 — aigclink · 2026-09-02
- Runway 发布界面世界模型 Solaris,AI 逐帧实时渲染可交互界面 — aigclink · 2026-09-02
- Fable 5.1 生成图展示:高精度还原恩多星球 — petergyang · 2026-09-02
- Opus 5 自主设计表情并生成说话视频演示 — repligate · 2026-09-02
- 从 Atlas 世界模型蒸馏表面网格:几何一致性超预期 — MatthewChang · 2026-09-02
- 刘子威团队发布原生统一多模态模型新论文 — liuziwei7 · 2026-09-02