OPPO 手机记忆基准 MobileMem:九大记忆系统无一及格,最强也只答对八成

MobileMem: Learning from a Year of Mobile Experiences

Xinle Deng, Yida Xue, Xiangyuan Ru, Haoming Xu, Shuofei Qiao, Mengru Wang, Yijun Chen, Buqiang Xu, Chen Jiang, Yuchen Eleanor Jiang, Lizhong Wang, Jianfeng Wang, Li Zeng, Haofen Wang, Guilin Qi, Huajun Chen, Ningyu Zhang

cs.AI, cs.CL, cs.LG, cs.MA, cs.MM

2026-08-11

OPPO 与浙大等发布移动端长期记忆基准 MobileMem,用知识引导的合成管线从真实手机使用轨迹造出全年尺度数据;九个记忆系统里最强的 A-MEM 总分也只有 79.7,Mem0 只有 35.6,多模态版最强的 M2A 也仅 31.8。

这篇在解决什么

下一代个人助理要能连续记住用户几个月甚至一年的经历,现有记忆基准却撑不住这个设定:数据是单会话拼起来的,记忆形态同质化,缺时间演化、缺跨应用、缺多模态。真实采集又贵又碰隐私红线。移动端还有一堆额外约束:存储和算力受限、记忆碎片化散落在日历相册笔记等十几个应用里、用户偏好持续变化不能灾难性遗忘、个人数据上云有隐私风险,必须本地处理。

方法

核心是 KEME 合成引擎(knowledge-guided experience synthesis for evolving memory),思路是不直接采集内容,而是从结构化先验知识出发合成轨迹。文本版 MobileMem 招募 2 名志愿者做访谈建用户画像,从其 OPPO 手机采集的只有应用使用统计与上下文信号(位置、蓝牙、网络状态),不含原始交互内容;画像配合 PersonaHub 种子扩展,LLM 再按应用消息模板生成具体交互,按时间戳切段成会话。多模态版 MobileMem-Omni 招 8 名志愿者加 8 个 LLM 生成的虚拟用户,配个人关系图和文生图人像,图像用 Seedream 为主力、多个模型轮换兜底,人脸一致性用 InsightFace 校验。出题用自底向上的层级遍历:叶节点出单点问答,内部节点把子题合成多跳、时序、更新、隐式偏好题;对抗题(无答案该拒答)单独成类。质检含人工抽检轨迹冲突、MLLM 过滤图文不匹配、人脸比对、LLM 验证证据充分性。

结果

文本版评测 9 个记忆系统 × 2 个 LLM 底座,判官用 Qwen3.5-397B。GPT-4.1-mini 底座下的总分:

系统总分单跳多跳时序建构 token 成本(千)
A-MEM79.786.379.883.32,545
HippoRAG278.985.779.087.511,170
Long Context(1M 窗口)54.556.551.758.30
NaiveRAG37.238.631.229.20
Mem035.638.127.350.05,436
LangMem24.823.615.020.82,509

A-MEM 与 HippoRAG2 领先的原因是它们不激进压缩、覆写或删除原始对话;Mem0 的抽取提示词只盯用户消息,经常漏掉应用侧与助手侧的关键事实。对抗题有个反直觉现象:总分垫底的 LangMem 在这类题上最好,因为强记忆系统会检索出弱相关但高度干扰的记忆,让模型误以为答案存在。成本上 A-MEM 每条轨迹建构要烧约 250 万 token,换 GPT-5.4-mini 底座时因抽取关键词暴涨而翻倍。

多模态版 MobileMem-Omni:16 个用户轨迹、19,060 张图、7,415 问答对,人均上下文 172 万 token、202.6 个会话。最强的多模态方法 M2A 总分 31.8,多模态长上下文 30.9,而纯文本方法借 GPT-5.1 生成的图片描述勉强追到 25.9。全场上限三成多,这个领域基本还是空的。中文题普遍低于英文题;把图片描述塞进 NaiveRAG,视觉题涨、文本题反而跌,粗粒度 caption 是干扰源。

错误分析抽样 80 个失败案例:Long Context 20 个里 13 个是上下文窗口截断,NaiveRAG 12 个是没检索到目标证据,四个系统共同的瓶颈是答案生成阶段被无关记忆带偏。

为什么重要

做 agent 记忆的团队可以直接拿这套基准当靶场,文本版和多模态版都开源。九个主流系统的分数落差本身就是一份技术选型表:保留原始对话、靠元数据和图结构提升召回的路线明显赢过激进压缩摘要的路线。KEME 的「结构化先验合成」思路可以复用到任何缺长程个性化数据的场景,隐私代价低。对抗题和 token 成本两列是大多数基准不报的维度,选型时这两项经常一票否决。

局限与存疑

作者自己列了三条:合成数据难免有噪声和不一致,用户建模还比较粗,评测的记忆系统与 LLM 代表性跟不上最新进展。实际读下来还有几处。文本版只有 2 名真人志愿者的画像,用户多样性极窄,多模态版 8 真 8 虚也没好太多。全部轨迹由 GPT-5.2/5.1 合成,LLM 的分布偏置会渗进数据,论文只做了抽样人工检查。LLM 判官的可靠性没有人工一致率背书。所谓「一年真实使用」其实只有使用统计是真的,交互内容全是合成的,标题与摘要给人的印象比实际更「真」。

术语

原文与代码

相关论文

全部论文解读