高通发布 IVD 基准,VLM 实时场景问答远逊人类

高通研究团队在 arXiv 发布论文及 Interactive Video Dataset(IVD)基准,用于评估连接摄像头与麦克风的视觉语言模型能否基于实时画面和音频,即时回答用户关于眼前场景的问题。结果显示,VLM 在实时面对面问答任务上的表现仍远远落后于人类,揭示了多模态模型在交互式实时理解方面的差距。

2026-10-02 ~ 2026-10-02 · 2 条相关