ReflectWorld-MM 把视频记忆按实体组织,在 6 项基准上拿到最好成绩
Xiaokang Ma · hf · 2026-07-21
ReflectWorld-MM 提出了一种面向“实体”的多模态记忆系统,用于开放式视频流。
- 论文指出,现有视频记忆系统大多把记忆留在模型上下文里,或放进扁平特征库中,并且按“帧”组织,而不是按视频里持续出现的实体来组织,因此难以处理长视频和跨时间追踪。
- 该系统由三部分组成:把音视频流转成实体级观测的感知前端;受人类记忆理论启发的分层长期记忆;以及一个可接入现成助手、可处理任意流式输入的完整实现。
- 长期记忆包含多尺度情景记忆、持续演化的实体语义记忆和程序性记忆。
- 在 6 个长视频与终身记忆基准上,论文报告都取得了最好成绩,超过了强基线记忆智能体和一个前沿模型。
「多模态」频道最新
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11
- ComfyUI 新节点发现器上线:按 star 增速过滤最新热门节点 — Luke2642 · 2026-09-11
- 用 MiniMax H3 MAX 对一只蚊子放大招,蚊子毫发无伤 — Hailuo_AI · 2026-09-11