VoxPolyMem: 多人语音对话长期记忆框架,超基线 23.6 分
Wenxu Jia · hf · 2026-09-30
论文提出 VoxPolyMem,针对多方语音对话的长期记忆问题——现有研究多聚焦双人文本/图文对话,多方场景需保留对话内容、跨会话识别说话人及“谁对谁说”的交互关系。
框架要点:
- 增量式说话人识别 + 三层记忆结构:交互记忆、事实记忆、参与者画像
- 把检索建模为序列决策:agent 改写查询、按累积证据选择检索工具与记忆层
- 提出 Evidence-Gain GRPO(EG-GRPO),用逐轮信用分配鼓励互补证据获取
- 构建 VoxPolyBench 评测记忆演化、个性化回答、检索推理与交互归因
结果:VoxPolyBench 总分 85.0,超最强基线 23.6 分;在 Mem-Gallery 与 H2HMem-Multi 上分别达 89.6 与 74.4,均超最强公开记忆基线 8 分以上。代码与数据集已开源。
「编程与Agent」频道最新
- 不换模型也能省 AI 账单:五招优化 LLM 使用成本 — goyalshaliniuk · 2026-09-30
- Open Pstack:Codex 当指挥,Devin 写码 Claude 审查 — CombinationOk2374 · 2026-09-30
- 用 Opus 驱动 Blender 做 VFX:把舞者瞬间定格成雕塑 — anselm · 2026-09-30
- 思科 2026 校招新环节:要求用 AI 工具做项目并记录提示词 — cneuralnetwork · 2026-09-30
- 本地生图一年:从 Civitai 到 ComfyUI,体验为何都烂 — BenDLH · 2026-09-30
- SpatialClaw:让 VLM 智能体用 Python 做空间推理,免训练提升 11.2 分 — _akhaliq · 2026-09-30