可穿戴助手既会答又主动提醒:GROVE 把视频流长成可分层检索的记忆

GROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video Experience

Sitong Gong, Caixin Kang, Tianyu Yan, Guo Chen, Bo Zheng, Kaipeng Zhang, Yunzhi Zhuge, Xiang Ruan, Huchuan Lu, Yifei Huang

cs.CV, cs.AI

2026-08-03

GROVE 免训练地从视频流长出分层记忆(感知痕迹、时刻、片段、跨日规律),同一套记忆既做问答检索、也做主动提醒,在多个长视频基准上领先。

这篇在解决什么

可穿戴助手(智能眼镜一类)既要能回答「上次见到这个人是什么时候」,也要能在合适的时候主动提醒「你该吃药了」。现有系统大多只会前者,而且是问才答;要主动就得另配一套记忆和控制机制,两套系统割裂。GROVE 想用同一座记忆同时干这两件事:从连续视频流里因果地长出记忆,既能被问题触发去检索,也能被当前情境触发去主动服务。

方法

记忆分四层,在线因果增长,不回看:最底是感知痕迹(物体计数与属性、主谓宾事件、屏幕文字);往上是时刻,带时间戳、角色和显著性权重;再往上是片段,变长的活动段带摘要和起止;最上是规律,跨片段重复出现的行为,带频率和典型时刻。每个视频窗口先做「双重感知」(叙事描述加结构化登记),用 LLM 判断活动是否延续来切分片段;片段闭合时原子化成时刻,再批量匹配已有规律。

检索配了四种与尺度对应的技能:感知查询(精确的计数、属性、文字)、时刻召回(按关键词或时间的何时何事事实)、片段回放(活动段)、规律遍历(跨期查询)。问答和主动服务共用这套记忆和技能:问答时 agent 跑一个最多 8 轮的有界循环按线索选技能;主动服务时按固定 schema 从当前感知状态填证据槽。整个系统免训练,只用冻结模型(Qwen3.5-35B-A3B 做感知,GPT-4.1-mini 做巩固,GPT-5.2 与 GPT-5-mini 做推理)。

结果

在主动服务基准 EgoServe 上,GROVE 的 Macro-F1 是 12.6,明显高于 EgoMemo(8.0)、GPT-5-mini(4.7)、Qwen3-VL-Plus(3.5),10 个服务子类里 7 个第一,安全、工具使用、错误恢复提升最大。在长视频问答 MM-Lifelong(181 小时)上,日、周、月划分分别 23.50、22.75、19.98,高于 ReMA 和 GPT-5。流式理解 OVO-Bench 总分 67.5、StreamingBench 65.1、ESTP-Bench 28.6,均领先。

消融证明分层不是摆设:去掉片段层,日尺度掉得最狠(18.75 降到 14.57);去掉规律层,周划分骤降(19.75 降到 13.00);关掉检索直接崩(日 18.75 降到 7.25)。完整层级下,agent 需要的检索轮数更少(6.25 降到 4.95)、延迟更低(59.3 降到 47.6 秒)。

为什么重要

对做智能眼镜、具身助手的团队,GROVE 给了一个不训练、可落地的长视频记忆方案,把被动问答和主动提醒统一进同一套结构。分层的好处是按尺度检索,省 token、降延迟,这点在端侧设备上很实际。它也示范了一种构造方向:用大模型当现成组件,把工程重点放在记忆结构和检索策略上,而非端到端再训一遍。

局限与存疑

作者列了几条:继承了冻结感知模型的错误;摄入阶段漏掉的证据事后补不回来;高层记忆只在片段闭合时才更新,实时查询只能靠底层感知痕迹;历史越长,记忆构建和多轮检索成本越高;不同基准用了不同骨干,跨基准的绝对比较站不住。

读下来还有一点要打折:整套系统把推理外包给 GPT-5.2 与 GPT-5-mini,数字里有多少是记忆结构的功劳、有多少是换了更强推理模型的功劳,消融没完全拆开。免训练也意味着每个新场景的提示工程都要重调。

术语

原文与代码

相关论文

全部论文解读