HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enhancement
Yiyang Cai, Nan Chen, Rongchang Xie, Junwen Pan, Chunyang Jiang, Cheng Chen, Wen Zhou, Zhenbang Sun, Wei Xue, Wenhan Luo, Yike Guo
cs.CV
2026-07-21
HOMIE 用全局多模态引导把 MLLM 参考语义注入自注意力,自建基准上抽象 logo 的 OCR 准确率做到 0.452,超 SkyReels-V3 近 13 个点。
主题驱动的视频生成里有一类任务叫「人物-物体中心视频个性化」(HOCVP):给几张参考图,生成一段特定的人与特定物体互动的视频。它同时要保住两件事:人的脸和物体的外观得像参考图,人与物体的交互方式还得对得上提示词。
此前的方法在这两端之间反复拉扯。要保真度,交互就糊;要交互自然,身份就漂。物体是抽象 logo 这类东西时尤其难,因为模型得有推理能力把它和参考图里的概念对上,而不是把图块直接复制粘贴。另一类做法是给同一主体多张参考图(多视角、OCR 文字图),指望它们提升保真度,但旧方法没有机制去理解这些参考之间的隐含对应。
引入多模态大模型(MLLM)来读懂参考图是个自然想法,但旧做法要么把 MLLM 特征硬对齐回 UmT5 文本嵌入空间,削弱文本编码器的可控性还把丰富特征塞进瓶颈,要么干脆用 MLLM 替掉文本编码器,重新对齐成本很高。HOMIE 的卖点是一个不牺牲文本可控性、也不用重新对齐的集成方式。
HOMIE 建在 Wan2.1-14B 和 Wan2.2-14B 两个视频扩散 transformer 上。参考图先交给 MLLM(Qwen3-VL-2B-Thinking)抽语义特征,过一层 MLP,再和视频 token、参考图 token 拼到一起送进 DiT。
核心是两个设计。全局多模态引导(GMG) 把 MLLM 的语义塞进 self-attention,做法不是简单拼接:它把 MLLM 的 query 和 key 沿时间维池化成全局表示,再用它对视频的 query 和 key 做仿射变换 Q̃v = (1+γ)×Qv + β,γ 和 β 都由 MLLM 表示生成。这样 MLLM 只负责「参考关系」这类高层语义,通用画面控制还是文本编码器说了算,两者不打架。
模态-参考嵌入(MRE) 是两套可学习嵌入:一套区分 token 来自视频、参考图还是 MLLM;另一套编码参考之间的归属,同一主体的多视角参考共享一个嵌入,不同主体则不同。这让模型能区分「这是同一张脸的两个角度」和「这是两个人」。
评测用的是作者自建的 200 条样本(100 条多主体,含 25 条抽象 logo;60 条 OCR 图;40 条多视角),没有公开标准集。
| 方法 | Face-Sim | Obj-Sim | OCR Acc |
| HOMIE (Wan2.1-14B) | 0.786 | 0.891 | 0.452 |
| Phantom | 0.801 | — | — |
| SkyReels-V3 | — | 0.847 | 0.326 |
| Kling 1.6 | 0.678 | — | — |
OCR 准确率上 HOMIE 把 SkyReels-V3 拉开近 13 个百分点,这是抽象文字/logo 参考的硬指标。消融里去掉 GMG 后 Face-Sim 从 0.786 掉到 0.697,去掉 MRE 后 OCR 掉到 0.376,两个模块各自扛得住一块。训练成本在 1 万 A100 GPU 小时量级。
视频生成正从「能动起来」往「能精准控制具体的人和物」走,HOMIE 给出的 MLLM 集成方式是一个不替换文本编码器、成本可控的工程答案。对做电商素材、个性化角色视频的团队,它演示了一条把语义理解和画面生成分层解耦的路子。
最大的问题是评测集只有 200 条自建样本,没有公开基准,也没有人类偏好评测。论文在附录里讨论了局限,但正文没展开。从方法看,整条管线依赖 MLLM 先把参考图读懂,一旦它对抽象 logo 的理解出错,下游生成也跟着错,这条依赖链没有单独压测。OCR 0.452 的绝对值也不算高,说明抽象参考仍是难点。