MLLM 引导修正:提升文本生成视频的语义准确性

kwangmoo_yi · x · 2026-08-19

该论文提出了一种无需训练的、可解释的中间生成修正框架。通过将多模态大语言模型 (MLLM) 的反馈直接集成到扩散采样循环中,利用 MLLM 检查当前去噪预览并进行语义评估,随后注入修正提示词。该方法包含语义评估监督者和语义修改助手两个模块,能在不修改模型参数的情况下提升视频生成的语义对齐、视觉保真度和时间一致性。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →