让视频字幕精准对应多张参考图:RefCaptioner 框架发布

KlingTeam · hf · 2026-07-31

现有的视频字幕模型无法将视频中的局部视觉元素明确对应到多张参考图片上。为此,研究者提出了多参考图视频字幕任务,并发布了 RefCaptioner 框架。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →