北大提出RefCaptioner:精准实现多参考图与视频语义绑定
机器之心 · wechat · 2026-08-11
北京大学与可灵团队联合提出了 RefCaptioner,旨在解决多模态大模型在处理多张参考图时,视频对象与参考图对应能力大幅下降的问题。
- 核心问题:现有的视频描述模型在面对多张参考图时,容易盲目引用或漏掉有效信息,且难以将同一主体的多视角图片归为同一实体。
- RefCaptioner 模型:基于 Qwen3-VL-8B,通过混合数据 SFT 保持通用描述能力,并设计了双层自适应奖励函数(HCD-GRPO)。该函数包含事实描述奖励、干扰项抑制(DAES)和跨参考图语义一致性(CRSC)三个模块,防止模型靠“多贴标签”作弊。
- MRVBench 基准:团队同步开源了包含 462 个视频、最多 22 张候选参考图的评测集,将“描述正确”与“图文对应”分开评测。
- 实验效果:8B 参数的 RefCaptioner 在多参考图 grounding 指标上取得开源最佳,综合表现接近 Gemini-3.1-Pro 且超越 GPT-5.4。下游视频重建测试也证实了其描述与参考图组合的高保真度。
「多模态」频道最新
- Grok Imagine 生成图直转视频,多模态逼真度惊艳 — XFreeze · 2026-08-11
- 首部全 AI 生成长片开源:耗资 200 万美元,已获名人肖像授权 — LinusEkenstam · 2026-08-11
- AI 视频翻车名场面:用 AI 让芝麻街重现《迈阿密风云》经典桥段 — dreamwieber · 2026-08-11
- AI生成10分钟长片爆火,单日播放破30万 — ZabihullahAtal · 2026-08-11
- 一笔触变化:AI视频工具将食材变拉面 — SimplyAnnisa · 2026-08-11
- 如何通过视频时长快速识别所用 AI 模型 — cocktailpeanut · 2026-08-11