VoiceMem双脑记忆框架:把语音AI记忆检索压到134毫秒

机器之心 · wechat · 2026-09-07

南洋理工大学谢之非一作、颜水成尾作的团队发布 VoiceMem,一个面向实时语音交互的「流式双脑」记忆框架,四所顶级高校与 OpenInteractionLab 联合推出,代码与论文均已公开。

它解决的问题有二:一是延迟——现有记忆系统检索约需 2000 毫秒,而语音对话从说完到开口总预算约 400 毫秒;VoiceMem 把检索拆成 listening、speechtail、anticipation、searching 四个子阶段并行执行,压缩到 134 毫秒并完全隐藏在 VAD 的 300 毫秒静音窗口内,LongMemEval 上 Top-10 检索即可对应 Mem0 Top-200 的精度,成本降低 95%。二是情感——「信息左脑」用双层图检索(联想层+检索层,兼容 Mem0/Zep)管理事实,LoCoMo 上仅用 5 条记忆拿到 91.2 分(Mem0 上百条只有 61.68);「情感右脑」用 Identity 节点沉淀稳定人格、Joint 节点把情绪与偏好绑定到事实记忆上,靠长短期情绪归因把冲突与偏好类题目的分数从一成多拉到七成以上。

团队称其为目前唯一实时交互可用的记忆系统,目标是实时交互版的「Mem0」。Qwen Audio Agent 已将其接入为可选记忆系统,可记住语音、说话人、声音事件等多模态信息。未来方向包括扩展多模态记忆、优化长期遗忘与强化机制、降低部署成本。作者谢之非为 Mini-Omni 端到端语音对话模型系列的主导者。

所属事件:VoiceMem双脑记忆框架将语音AI检索延迟压至134毫秒(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →