Amazon 提出 GEB 框架,为长视频记忆建立「实体传记」,EgoLifeQA 准确率 72%
amazon · hf · 2026-09-30
Amazon 团队在 Hugging Face 发布长视频记忆新框架 Grounded Entity Biographies(GEB),解决长视频问答中的实体身份追踪难题。
核心问题:回答跨越数小时甚至数天的视频问题时,按时间顺序的描述和文本实体无法解决物理身份一致性——不同物体可能共享同一描述,同一物体在不同事件中的观测彼此割裂。
方法:GEB 将同一物理实例在多个片段中的视觉定位观测分组为可检索的「实体传记」,保留每个时刻的上下文;问答时传记与情节证据一同检索,模型可沿记忆构建时建立的身份链接追踪实体。
结果:在四个基准(含全天、全周长度的录像)上超越已有记忆框架;EgoLifeQA 上达 72.0% 准确率,比此前最佳高 4.4 个百分点。消融实验表明,基于视觉的身份关联和传记阅读均对提升有贡献,仅靠追加描述无法复现。
「研究」频道最新
- Hugging Face 发布 tokenizers v1:性能较 v0.23 提升数十倍 — ariG23498 · 2026-09-30
- EMNLP 口头报告:RL 教模型更高效遍历参数化知识 — niloofar_mire · 2026-09-30
- Midas Touch 代码数据集遭质询:可复现性与数据泄漏存疑 — maier_ak · 2026-09-30
- Midas Touch:直接从源码扩展 AI 编码环境的新论文 — maier_ak · 2026-09-30
- 预训练算力超 1e22 FLOPs 后可直接砍掉视觉编码器 — heghbalz · 2026-09-30
- 研究者预言神经网络或可分解为演化式符号系统 — QuintinPope5 · 2026-09-30