让视频字幕精准对应多张参考图:RefCaptioner 框架发布
KlingTeam · hf · 2026-07-31
现有的视频字幕模型无法将视频中的局部视觉元素明确对应到多张参考图片上。为此,研究者提出了多参考图视频字幕任务,并发布了 RefCaptioner 框架。
- 技术方案:这是一个两阶段后训练框架,结合了混合数据微调(SFT)与分层覆盖折扣 GRPO 算法,以提升参考选择、短语级绑定和跨引用一致性。
- 数据与评测:构建了包含 2 万视频和 17 万参考图的语料库,并提出了 MRVBench 基准来评估字幕事实性和多参考引用能力。
- 效果:实验表明,RefCaptioner 在开源模型中整体表现最佳,且在标准视频字幕任务上保持竞争力,人类评估也证实其生成的字幕更受偏好。
「多模态」频道最新
- 海螺AI展示单图生成15秒视频能力 — LudovicCreator · 2026-07-31
- MiniMax H3 视频模型上线竞技场,即将开放权重 — arena · 2026-07-31
- 脑洞大开:用 AI 构想外卖“飞鸽配送”躲避拥堵 — sivakumaranvlsi · 2026-07-31
- MiniMax H3 视频模型上线 Vercel AI Gateway — evilrabbit_ · 2026-07-31
- 实测Flux 3:超长复杂提示词生成双视角同步视频 — umesh_ai · 2026-07-31
- 图像编辑一多人就肢体乱飞?MPIE-Bench 专治解剖学异常 — muset-ai · 2026-07-31