HOMIE 用多模态对齐提升人-物视频个性化生成
Yiyang Cai · hf · 2026-07-21
HOMIE 是一个面向“人-物”中心视频个性化生成的多模态框架。
- 论文聚焦 subject-driven video generation。现有方法往往难以同时兼顾主体一致性和正确的人物-物体交互,尤其当物体是 logo 这类抽象概念时更难处理。
- 它还处理 intra-subject 参考输入,例如 OCR map 或多视角图像。作者认为这些输入本应提升主体一致性,但此前方法往往没有把潜在对应关系理解好。
- HOMIE 采用更好的 MLLM 融合策略,在 self-attention 中加入全局多模态引导,把语义特征更好地对齐到 VAE tokens;同时引入 modality-reference embedding,用来区分 MLLM 特征和 VAE tokens,并关联参考图像 token。
- 论文宣称在多个 HOCVP 任务上取得了 SOTA。
所属事件:HOMIE框架基于Qwen3-VL实现人-物视频个性化生成(2 条相关)→
「多模态」频道最新
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11
- ComfyUI 新节点发现器上线:按 star 增速过滤最新热门节点 — Luke2642 · 2026-09-11
- 用 MiniMax H3 MAX 对一只蚊子放大招,蚊子毫发无伤 — Hailuo_AI · 2026-09-11