Amazon 提出 GEB 框架,为长视频记忆建立「实体传记」,EgoLifeQA 准确率 72%

amazon · hf · 2026-09-30

Amazon 团队在 Hugging Face 发布长视频记忆新框架 Grounded Entity Biographies(GEB),解决长视频问答中的实体身份追踪难题。

核心问题:回答跨越数小时甚至数天的视频问题时,按时间顺序的描述和文本实体无法解决物理身份一致性——不同物体可能共享同一描述,同一物体在不同事件中的观测彼此割裂。

方法:GEB 将同一物理实例在多个片段中的视觉定位观测分组为可检索的「实体传记」,保留每个时刻的上下文;问答时传记与情节证据一同检索,模型可沿记忆构建时建立的身份链接追踪实体。

结果:在四个基准(含全天、全周长度的录像)上超越已有记忆框架;EgoLifeQA 上达 72.0% 准确率,比此前最佳高 4.4 个百分点。消融实验表明,基于视觉的身份关联和传记阅读均对提升有贡献,仅靠追加描述无法复现。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →