HOMIE 用多模态对齐提升人-物视频个性化生成
Yiyang Cai · hf · 2026-07-21
HOMIE 是一个面向“人-物”中心视频个性化生成的多模态框架。
- 论文聚焦 subject-driven video generation。现有方法往往难以同时兼顾主体一致性和正确的人物-物体交互,尤其当物体是 logo 这类抽象概念时更难处理。
- 它还处理 intra-subject 参考输入,例如 OCR map 或多视角图像。作者认为这些输入本应提升主体一致性,但此前方法往往没有把潜在对应关系理解好。
- HOMIE 采用更好的 MLLM 融合策略,在 self-attention 中加入全局多模态引导,把语义特征更好地对齐到 VAE tokens;同时引入 modality-reference embedding,用来区分 MLLM 特征和 VAE tokens,并关联参考图像 token。
- 论文宣称在多个 HOCVP 任务上取得了 SOTA。
所属事件:HOMIE框架基于Qwen3-VL实现人-物视频个性化生成(2 条相关)→
「多模态」频道最新
- Hugging Face 截图显示 Anima 扩散模型多个版本 — RafiHDW · 2026-07-21
- Seedance 2.0 把罗马意面做成了 AI 反应梗图 — azed_ai · 2026-07-21
- 一套月食梦境图像提示词,附多张生成示例 — LudovicCreator · 2026-07-21
- Midjourney 8.2 预览版展示双重曝光与风格控制效果 — michaelrabone · 2026-07-21
- Travel MCP Server 为智能体补上旅行规划工具 — modelcontextprotocol · 2026-07-21
- Douyin 视频分析 MCP 可把分享链接转成结构化摘要 — modelcontextprotocol · 2026-07-21