NVIDIA推Voice Memory:用可编辑记忆文件优化语音识别
nvidia · hf · 2026-07-31
NVIDIA 提出了用于 Agent 语音识别的推理阶段方案 Voice Memory。该方案采用“听者-思考者”架构,核心机制如下:
- 听者:在流式推理时,读取特定领域的 memory.md 文件,决定是否对当前识别结果进行修正。
- 思考者:异步更新该记忆文件,仅在严格提升验证集分数时才接受修改。
这种设计无需改变模型权重,使学到的技能具备可审计性和可移植性。实验显示,无约束的生成式纠错往往会“过度修正”,破坏正确词汇(在财经新闻中破坏率高达 64%),而 Voice Memory 将该破坏率降至 35%。在十个测试领域中,该方案将加权词错率(WWER)从 8.36% 降至 7.52%,且未增加任何推理参数。
「研究」频道最新
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24
- 研究揭示 AI Agent 行为:六成阅读量来自指令与笔记 — dair_ai · 2026-08-24
- Claude 自主验证 43 个数学模块,AI 攻克理论物理难题 — Tkaraletsos · 2026-08-24
- AI 假记忆:为何模型越用越错,真记忆需遗忘 — PrajwalTomar_ · 2026-08-24