宾大博士生推出 InteractionBench:评估多模态系统何时该开口何时沉默
thoma_gu · x · 2026-10-07
宾大一年级博士生 Enxin Song 团队发布 InteractionBench,针对实时视频助手的核心决策——什么时候回应、什么时候保持沉默——进行评估。作者指出离线分数无法衡量这种实时交互判断能力。
该基准评测的是模型、记忆与响应控制器组成的完整系统,共包含 1060 段交互、覆盖 812 个视频。导师 thomagu 认为这是通向真实世界物理 AI 的垫脚石。
「研究」频道最新
- SIGGRAPH Asia 2026 公布三位主讲:迪士尼首席科学家、华为图形架构师等 — AlexTensor · 2026-10-07
- CoreWeave 推出 RL Rollouts:热加载新权重,比重新部署快约 15 倍 — _ScottCondron · 2026-10-07
- CHI 2027 审稿量表遭研究者吐槽:原创性与新颖性重复,缺「质量」项 — IanArawjo · 2026-10-07
- Overmind:小模型在法律/生物医学/航空安全基准上全面超越前沿模型 — rohanpaul_ai · 2026-10-07
- 详解 MOPD:多教师在线蒸馏把多个专精模型合并进一个学生模型 — cwolferesearch · 2026-10-07
- Scale AI 开源 AgentEnv:构建智能体强化学习环境的内部框架 — AAAzzam · 2026-10-07