VoxMem 基准:15 个音频大模型记忆能力无一超过 40%
unimelb-hf · hf · 2026-09-30
墨尔本大学发布 VoxMem,首个系统评测大型音频语言模型(LALM)多会话记忆能力的基准。要点:
- 规模与设计:3,196 个评测实例,来自 34,743 段语音会话(共 177 小时),沿「声学证据类型 × 记忆操作」两轴构建分类法,覆盖 8K-64K token 的上下文预算。
- 四个证据维度:语义内容、说话人身份、副语言线索、环境声音——后三者只存在于音频信号,无法从转写文本恢复。
- 四种记忆操作:信息抽取、跨会话推理、时序状态追踪、拒答。
- 核心发现:评测 15 个 LALM,32K 上下文下无一超过 40%;模型对「说了什么」的记忆远好于「谁说的、怎么说、背景有什么声音」,且这一差距随操作复杂度和历史长度增加而扩大,不同证据类型呈现质的不同失败模式。
「研究」频道最新
- 图像判断基准 ImageJevBench v0.2 发布:573 图,Imajev 4B 居首 — airesearch12 · 2026-09-30
- alphaXiv 开源 OpenResearch 桌面版:把编码 Agent 变科研 Agent — gekobraa · 2026-09-30
- 政府气象模型 WRF 移植 GPU,速度快一个量级出 250 米分辨率 — Scobleizer · 2026-09-30
- François Fleuret:AI 数学将让人类数学彻底边缘化 — francoisfleuret · 2026-09-30
- GPU 空转高达 74%,微软研究院 SortedRL 直击 RL 训练调度瓶颈 — burkov · 2026-09-30
- UMass 教授 Luc Rey-Bellet 三套随机过程讲义公开,覆盖 MCMC 基础 — michaelchchoi · 2026-09-30