ReflectWorld-MM 把视频记忆按实体组织,在 6 项基准上拿到最好成绩
Xiaokang Ma · hf · 2026-07-21
ReflectWorld-MM 提出了一种面向“实体”的多模态记忆系统,用于开放式视频流。
- 论文指出,现有视频记忆系统大多把记忆留在模型上下文里,或放进扁平特征库中,并且按“帧”组织,而不是按视频里持续出现的实体来组织,因此难以处理长视频和跨时间追踪。
- 该系统由三部分组成:把音视频流转成实体级观测的感知前端;受人类记忆理论启发的分层长期记忆;以及一个可接入现成助手、可处理任意流式输入的完整实现。
- 长期记忆包含多尺度情景记忆、持续演化的实体语义记忆和程序性记忆。
- 在 6 个长视频与终身记忆基准上,论文报告都取得了最好成绩,超过了强基线记忆智能体和一个前沿模型。
「多模态」频道最新
- Seedance 2.0 把罗马意面做成了 AI 反应梗图 — azed_ai · 2026-07-21
- 一套月食梦境图像提示词,附多张生成示例 — LudovicCreator · 2026-07-21
- Midjourney 8.2 预览版展示双重曝光与风格控制效果 — michaelrabone · 2026-07-21
- Travel MCP Server 为智能体补上旅行规划工具 — modelcontextprotocol · 2026-07-21
- Douyin 视频分析 MCP 可把分享链接转成结构化摘要 — modelcontextprotocol · 2026-07-21
- Synthesia 推出 Dubbing 2.0,支持 130 多种语言唇形翻译 — synthesiaIO · 2026-07-21