高通发布 IVD 基准:VLM 实时回答现实场景问答远落后人类
rishit_dagli · x · 2026-10-02
高通团队发布 Qualcomm Interactive Video Dataset(IVD),测试连接摄像头和麦克风的视觉语言模型能否基于实时画面与音频,即时回答用户关于眼前场景的提问——这是现实 AI 助手与人形机器人交互的前提。
- 设定:用户口头提问,系统须基于实时摄像头画面与音频流实时作答
- 结论:现有模型在此任务上大幅落后人类表现,论文定位了差距的主要来源
- 关键发现:对许多所需感知技能,用此类数据微调可显著缩小差距
- 论文还分享了训练此类场景 VLM 的数据与训练技巧
所属事件:高通发布 IVD 基准,VLM 实时场景问答远逊人类(2 条相关)→
「具身」频道最新
- 首尔大学 BeyondSCe:机器人凭历史事件抓取被遮挡目标,成功率 77% — SeoulNationalUniv · 2026-10-02
- NUS 提出 APPL:用结构先验打通机器人技能学习与技能组合 — NationalUniversityofSingapore · 2026-10-02
- 开源硬件 Harness 玩家自改固件:把 Agent 从 App 搬进 orca — dee_hw · 2026-10-02
- YC F26 项目 Preload:给机器人数据加上「触觉神经」 — ycombinator · 2026-10-02
- 北大 DexPolicy:探索噪声退火让灵巧手操作成功率升至 85% — PekingUniversity · 2026-10-02
- 控制学者反驳:域随机化牺牲精度,RL 并非万能解 — KyleMorgenstein · 2026-10-02