Vinci2提出主动视频助手:基于持续第一视角视频,自主判断何时介入
机器之心 · wechat · 2026-08-17
大连理工大学、AlayaLab与东京大学团队联合提出Vinci2,将第一人称视频助手的主动服务形式化为基于持续视频流的「决策+生成」联合任务。其包含首个主动服务评测基准EgoServe和免训练的记忆增强智能体EgoMemo,已被ECCV 2026接收,代码与数据集已开源。
EgoServe基准:覆盖超128小时视频、超3400个服务实例,按时间记忆跨度分为即时、短期、情景、长期四层级共10个子类别,评测介入时序精度与回复质量。
EgoMemo智能体:免训练,流式构建多尺度时序记忆、演化知识图谱和视觉嵌入档案,通过三重并行检索与VLM描述重构实现主动介入决策。在EgoServe上大幅超越Qwen3-VL-Plus和GPT-5-mini,尤其在情景与长期服务上提升显著;在OVO-Bench、ESTP-Bench、EgoSchema等基准上亦取得SOTA。
「研究」频道最新
- COLM 2026 论文:拆解多语言模型安全降级原因 — davlanade · 2026-08-17
- 最大规模开放实验:前沿模型自主AI研究,最佳成绩缩小82%差距 — inductionheads · 2026-08-17
- DeepMind 展示整块推理模型:自纠错解数独 — mtizard · 2026-08-17
- 大模型真实工作能力评测:通过率惨淡,远低于代码任务 — 数字生命卡兹克 · 2026-08-17
- Delip Rao 痛批 AI for Science:现有 Agent 成功多为幸存者偏差 — deliprao · 2026-08-17
- SCoPE 演示上线:无引擎重建,单图生成任意相机路径视频 — yshan2u · 2026-08-17