谢之非团队推出 VoiceMem:双脑记忆让实时语音 Agent 近零延迟「懂你」
青稞AI · wechat · 2026-09-07
南洋理工大学、清华、港中文等机构研究者(一作谢之非,通讯颜水成)发布 VoiceMem,一套面向实时语音 Agent 的长期记忆框架,解决记忆检索引入 50-200 毫秒以上延迟、打断对话节奏的痛点。
核心架构:
- 信息左脑:以 Schema-Entity 两级索引组织事实记忆,用「簇涌现」机制让新类别从使用中自然生长;实验中 49.8% 记忆被归入非预设的涌现类别。
- 情感右脑:并行维护独立人格节点与跨实体情感节点,做短期/长期情感归因,区分一时情绪与稳定人格。
流式设计:把流程拆为 listening/speechtail/anticipation/searching 四阶段,在用户说话时提前定位记忆,双脑检索仅 134 毫秒,配合 VAD 留出的约 400 毫秒窗口实现近零额外延迟。
评测:LoCoMo 上仅检索 5 条记忆得 91.2 分,超过 Mem0 检索 200 条近 30 分;人格记忆 74.16 分超最强基线 MemOS 1.89 分;自建 ChatMem-Bench(15,314 轮对话、约 53 小时音频)中 11/14 类能力领先,声学类问题显著超过文本系统。已开源框架、数据集与 Demo,并提供 Qwen Audio Agent 接入方案。
所属事件:VoiceMem双脑记忆框架将语音AI检索延迟压至134毫秒(2 条相关)→
「研究」频道最新
- LLM 复活经典 Put-That-There:语音加手势在 XR 里免手放窗口 — twi_mar · 2026-09-07
- 乐谱转 MIDI 再喂模型:结构化表示优于音频扩散方案 — felpix_ · 2026-09-07
- Seen2Scene 开源:只用真实残缺扫描训练 3D 场景补全,入选 ECCV 2026 — angelaqdai · 2026-09-07
- 2019 年 Coconet 早已用自回归模型生成巴赫风格乐谱 — felpix_ · 2026-09-07
- 可解释性研究该归功谁?Casper 指向 2017 年 Doshi-Velez 奠基论文 — StephenLCasper · 2026-09-07
- 开源无依赖 LLM 评测工具:盯回归而非平均分 — zahidsaim23 · 2026-09-07