北大 Kling 团队推 RefCaptioner,解决视频理解幻觉难题
jiqizhixin · x · 2026-08-19
当前视频模型在理解内容时常出现幻觉,如将红裙错认为狗。北大与 Kling 团队提出 RefCaptioner,致力于将视频内容精准锚定到参考图像。其方案采用两阶段训练:混合数据监督微调 + 自定义 RL 步骤(HCD-GRPO),奖励正确的短语-图像绑定并惩罚幻觉参考。模型在 20K 视频、171K 参考图上训练,在新基准 MRVBench 上达 SOTA,超越开源对手,并生成人类更偏好的描述及更忠实的视频生成。
「多模态」频道最新
- 音频水印科普长文:AI 音乐时代的所有权与反水印博弈 — TheChuckTone · 2026-08-19
- MiniMax H3 生成“动物挤罐子”视频效果惊艳 — doublescale · 2026-08-19
- SIGGRAPH 2025:Meta 开源单目 3D 高斯在线重建库 — rsasaki0109 · 2026-08-19
- MiniMax 发布桌面端创作平台:全流程 Agent 工作流 — aziz4ai · 2026-08-19
- 实测 MiniMax Design:传音频生成埃及风 MV 效果佳 — aziz4ai · 2026-08-19
- AI 生成产品广告视频:Freshly Made 创意展示 — littleteckmonkey · 2026-08-19