高通团队发布 IVD 基准:VLM 实时面对面问答仍远落后人类
rishit_dagli · x · 2026-10-02
高通研究团队(作者含 Rishit Dagli 等)在 arXiv 发布论文与 Qualcomm Interactive Video Dataset(IVD) 基准,评估 VLM 能否像真实助手一样,基于摄像头与麦克风输入对正在发生的场景进行实时对话问答。
- 测试设置:用户面对镜头提问,系统须实时结合视觉与音频作答,是真人助手与人形机器人交互的前提能力。
- 核心发现:现有模型在该任务上远落后于人类表现,论文分析了差距的主要来源。
- 关键结论:对许多所需感知技能,在 IVD 这类数据上微调可显著缩小差距;论文还分享了此类场景下训练 VLM 的数据与训练技巧。
所属事件:高通发布 IVD 基准,VLM 实时场景问答远逊人类(2 条相关)→
「研究」频道最新
- Meta 论文:推荐系统训练中仅 50-60% 时间真正在训练 — _reachsumit · 2026-10-02
- OmniSeek:让全模态大模型学会主动“看与听”检索证据 — Haibo Wang · 2026-10-02
- Netflix 发布口型同步裁判 ATR,七语言基准 AUC 提升 50%+ — netflix · 2026-10-02
- 北大 DexPolicy:探索噪声退火让灵巧手操作成功率升至 85% — PekingUniversity · 2026-10-02
- 微软 ActiveSaddler:自动课程学习让 Agent harness 提升 7.5 个百分点 — microsoft · 2026-10-02
- 阿里提出 PoS:显式信念状态治「信念陷阱」,四个基准全面领先 — alibabagroup · 2026-10-02