微软发布 VibeVoice-ASR-Streaming:首个 LLM 端到端流式说话人归属识别
realmrfakename · x · 2026-09-04
微软团队(含 Li Dong、Furu Wei 等)发布论文《VibeVoice-ASR-Streaming Technical Report》,提出首批基于 LLM 的端到端流式说话人归属 ASR 之一:
- 传统方案把 ASR 与说话人分离(diarization)当两个任务;已有统一模型(如 VibeVoice-ASR)仍主要支持离线识别,难以满足实时语音助手低延迟需求
- 方法:将固定大小音频块、少量前瞻音频和已生成文本交错输入,语音到达即输出「谁说了什么」,无需独立 diarization 阶段
- 成绩:7B 模型在 5 个评测集上取得最低平均 WER/CER;说话人归属在 13 个评测设置中的 12 个取得最优或并列最优
- 开源 1.5B 与 7B 模型权重及推理代码
所属事件:微软开源 VibeVoice 流式语音识别模型,转写兼区分说话人(6 条相关)→
「多模态」频道最新
- Comfy H3 配音挑战赛揭晓:近 50 国数百作品角逐四项大奖 — Comfy-Org · 2026-09-04
- Fable 5.1 实时生成开放世界游戏:边玩边生成剧情 — isidentical · 2026-09-04
- 高效推理团队推出 Nunchux,一个 API 聚合 30+ 图像视频模型 — junyanz89 · 2026-09-04
- Astra 3D 建模演示合集刷屏:Opus 驱动实时生成 — TFenrir · 2026-09-04
- 网友用 GPT-6 Astra 混改 fal 视频模型,晒出原型 demo — OdinLovis · 2026-09-04
- 用户称 Ideogram 的 bbox 提示词折磨练出了 MiniMax-H3 适应力 — Nimblecloud13 · 2026-09-04