MLLM 引导修正:提升文本生成视频的语义准确性
kwangmoo_yi · x · 2026-08-19
该论文提出了一种无需训练的、可解释的中间生成修正框架。通过将多模态大语言模型 (MLLM) 的反馈直接集成到扩散采样循环中,利用 MLLM 检查当前去噪预览并进行语义评估,随后注入修正提示词。该方法包含语义评估监督者和语义修改助手两个模块,能在不修改模型参数的情况下提升视频生成的语义对齐、视觉保真度和时间一致性。
「多模态」频道最新
- Reddit 用户用 AI 制作儿童奇幻电影短片 — MosskeepForest · 2026-08-19
- LTX-2.5 开源权重实测:视频生成效果惊艳 — tom_doerr · 2026-08-19
- ChatGPT 生成的奇点传奇人物:Vernor Vinge 肖像 — DeryaTR_ · 2026-08-19
- 发布 Lora 模型用于视频增强与修复 — CQDSN · 2026-08-19
- PNS 论文:可训练神经细分规则补齐 Loop 细分短板 — ssh4net · 2026-08-19
- 用 T2V 与 R2VA 生成《吸血鬼猎人D》风格角色 — SIR_NVAX_A_LOT · 2026-08-19