北大提出RefCaptioner:精准实现多参考图与视频语义绑定

机器之心 · wechat · 2026-08-11

北京大学与可灵团队联合提出了 RefCaptioner,旨在解决多模态大模型在处理多张参考图时,视频对象与参考图对应能力大幅下降的问题。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →