VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction
Zhifei Xie, Jiaqi Lang, Ze An, Yifan Zhao, Dongchao Yang, Kai Li, Ziyang Ma, Mingbao Lin, Chunyan Miao, Shuicheng Yan
eess.AS, cs.AI, cs.IR, cs.MM, cs.SD
2026-08-27
给实时语音对话加一套流式双脑记忆:左脑管事实、右脑管人设与情绪。默认 top-5 检索只要 134 毫秒,信息记忆均分 76.39,比后端 Mem0 的 52.27 高出 24 分。
实时语音模型已经能边听边说,但记忆仍按文本 Agent 的节奏来:检索动辄 2 到 3 秒,一次塞进 top-100 条,远远超出 500 毫秒的话轮预算,也撑爆语音模型能吃下的上下文。情绪与人设更是后补:现有情绪 RAG 多半只在检索分里加一项情感相似度,没法把「这个人长期什么样」和「他对某件事当下什么态度」分开存。
VoiceMem 把记忆做成语音对话的基础设施,而不是事后挂上的插件。目标有三条:top-5 就要准,检索藏进 VAD 静音窗口,事实与情感并行维护。
系统拆成上下两层。上层是双脑索引,下层是可替换的记忆引擎,论文默认接 Mem0。左脑管事实,用 schema 加实体两级索引:schema 做粗路由,实体指向具体的人、事、概念。检索时先在部分转写上匹配 schema 和实体,再沿强弱一跳边扩张,最后只在缩小后的候选池里搜。集群变大后信息会变稀,于是加了一套涌现机制:反复被一起召回的实体子图,过了连贯性阈值再经 LLM 判定,才升成新集群。
右脑管「这个人是谁」。独立节点存稳定性情与长期倾向,跨实体节点把情绪钉在左脑某个实体上,避免把对某件事的火气写成性格。短时归因跟每一轮走,长时归因在会话结束后把反复出现的证据收成独立节点。
延迟靠四段流式查询吃掉:听写阶段同步做匹配,静音 200 毫秒后开始扩图和嵌入,400 到 500 毫秒才打后端搜索。标准 VAD 常设 500 毫秒,真正的密集检索只要 134 毫秒。为了让语音模型会用记忆,团队用闭源教师做在线黑盒蒸馏,造出 ChatMem-400K,并人工整理出覆盖信息、人设、情绪归因、副语言与环境四类能力的 ChatMem-Bench。
信息记忆三条基准上,VoiceMem 均分 76.39,Mem0 是 52.27,当时最强的 MemOS 是 65.83,全上下文也只有 60.49。LoCoMo 上默认 K=5 达到 91.2 分、430 个记忆 token、134 毫秒;EverMemOS 要 1899 个 token 才到 83.13。K 从 3 扫到 100,延迟几乎不变,因为 schema 路由先把候选池卡住了。去掉上层索引,LoCoMo 在 K=5 掉 9.9 分。
人设三条基准上,接 GPT-4o-mini 均分 74.16,比 MemOS 的 72.27 高 1.89;换成微调过的回复模型到 76.56,相对 MemOS 高 4.29。ChatMem-Bench 共 316 题、53 小时音频,均分 68.73,MemOS 是 53.95。差距最大的是副语言与环境三类:文本系统大约 3 到 27 分,VoiceMem 做到 45 到 54。同一套上层索引接到 LangMem 和 Zep 上,LoCoMo 分别再抬 15.76 和 22.92 分。
做实时语音助手的人,现在有一套可以挂在现有记忆引擎上面的路由层:不用把检索预算开到 top-100,也不用在话轮里再等两秒。人设和情绪不再是检索分里的一个加权项,而是单独维护、能指到具体实体的图。底层引擎可换,论文已经在三个后端上验证过增益。
这不是新的端到端语音大模型。它是记忆基础设施,默认仍吃 ASR 转写,音频作为可选节点挂上去。
论文没有单独开 Limitations 节。ChatMem-Bench 的详细标注协议被推到后续技术报告,外部只能看到 316 题的分项,很难独立复现出题标准。人设增益在 GPT-4o-mini 下只有 1.89 分,和摘要里用微调模型报的 4.29 分不是同一设置。信息记忆的「高近 30 分」对的是 Mem0 在更大 top-k 下的结果,同等 K=5 时 LoCoMo 大约高 24 分,引用时要看清对照。
四段流水线默认用户会停够 200 毫秒。全双工抢话、边说边改的场景,预取查询可能对不上最终转写。右脑的巩固依赖会话级 LLM 调用,长期漂移和误归因没有用户研究。训练数据由教师模型在合成记忆世界里生成,真实语音噪声、方言、多人抢话会不会把匹配打歪,还没有部署数字。