Vinci2提出主动视频助手:基于持续第一视角视频,自主判断何时介入

机器之心 · wechat · 2026-08-17

大连理工大学、AlayaLab与东京大学团队联合提出Vinci2,将第一人称视频助手的主动服务形式化为基于持续视频流的「决策+生成」联合任务。其包含首个主动服务评测基准EgoServe和免训练的记忆增强智能体EgoMemo,已被ECCV 2026接收,代码与数据集已开源。

EgoServe基准:覆盖超128小时视频、超3400个服务实例,按时间记忆跨度分为即时、短期、情景、长期四层级共10个子类别,评测介入时序精度与回复质量。

EgoMemo智能体:免训练,流式构建多尺度时序记忆、演化知识图谱和视觉嵌入档案,通过三重并行检索与VLM描述重构实现主动介入决策。在EgoServe上大幅超越Qwen3-VL-Plus和GPT-5-mini,尤其在情景与长期服务上提升显著;在OVO-Bench、ESTP-Bench、EgoSchema等基准上亦取得SOTA。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →