清华 KBMR:按语义实体嵌入图像,提升知识型视觉问答检索
Tsinghua · hf · 2026-09-03
清华大学发布 KBMR 方法,针对知识型视觉问答(KB-VQA)中的检索问题提出新思路。
- 传统检索按视觉相似度匹配图片,容易因表面外观相近而检索到错误实体;KBMR 改用多模态语言模型将图像按「语义身份」嵌入,即 embedding 对齐的是实体本身而非外观。
- 训练上采用连续蒸馏(continuous distillation)与难负样本采样(hard negative sampling),让检索结果更贴合问题所需的知识实体。
- 官方称该方法同时改善了检索质量与下游视觉问答的准确率。
「多模态」频道最新
- 十年品牌设计老兵:用一张参考图 + AI 搭建高端视觉系统 — GCWebDesigner · 2026-09-03
- ComfyUI 实战:低显存跑 MiniMax H3 视频编辑与蒙版重绘 — Maleficent-Tell-2718 · 2026-09-03
- Minimax FL2VA H3 支持 Reference Voice,日语悟空声线实测 — Willow-External · 2026-09-03
- 开源实验:用 DLSS 5 在游戏引擎外做视频神经渲染播放器 — 2600th · 2026-09-03
- 眼镜店主自学 AI 用可灵做中国神话视频,播放量超 7500 万 — aziz4ai · 2026-09-03
- Minimax H3 MAX 上线 comfy.org 云端,价格高且内容全面审查 — Puzzleheaded_Art2809 · 2026-09-03