谢之非团队推出 VoiceMem:双脑记忆让实时语音 Agent 近零延迟「懂你」

青稞AI · wechat · 2026-09-07

南洋理工大学、清华、港中文等机构研究者(一作谢之非,通讯颜水成)发布 VoiceMem,一套面向实时语音 Agent 的长期记忆框架,解决记忆检索引入 50-200 毫秒以上延迟、打断对话节奏的痛点。

核心架构:

流式设计:把流程拆为 listening/speechtail/anticipation/searching 四阶段,在用户说话时提前定位记忆,双脑检索仅 134 毫秒,配合 VAD 留出的约 400 毫秒窗口实现近零额外延迟。

评测:LoCoMo 上仅检索 5 条记忆得 91.2 分,超过 Mem0 检索 200 条近 30 分;人格记忆 74.16 分超最强基线 MemOS 1.89 分;自建 ChatMem-Bench(15,314 轮对话、约 53 小时音频)中 11/14 类能力领先,声学类问题显著超过文本系统。已开源框架、数据集与 Demo,并提供 Qwen Audio Agent 接入方案。

所属事件:VoiceMem双脑记忆框架将语音AI检索延迟压至134毫秒(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →