小米开源 CocktailASR-1:锁定单一目标说话人的语音识别 SOTA
solyarisoftware · x · 2026-09-17
小米发布目标说话人语音识别大模型 Xiaomi-CocktailASR-1,通过参考声纹从混合音频中定位并只转写目标人声,开源在 GitHub。
- 多说话人 SOTA:在 AliMeeting、AMI、LibriMix 等测试集上达到最优,LibriMix 2mix WER 4.11%,大幅优于 Qwen3-ASR(68.75%)、Gemini(48.41%)等
- 单说话人兼容:同一模型兼顾单人与多人场景,性能可比普通 ASR
- 负样本拒识:对非目标说话人音频零误触发
- 思维链推理:对识别过程提供可解释推理
- 支持中英文
「模型」频道最新
- 自称 ChatGPT 联合发明者发布自动化基础模型 Jev:宣称快 20-200 倍、便宜 40-400 倍 — hardimanjames · 2026-09-17
- Burkov 算账:OpenAI 砍掉 20x 套餐,5x 恐怕也只是勉强保本 — burkov · 2026-09-17
- 前沿 LLM 竟无时间概念,开发者呼吁把速度纳入评测 — gandamu_ml · 2026-09-17
- 重度量化的 Qwen 3.8 27B 自主找到无头浏览器测试自己写的代码 — satnl · 2026-09-17
- Garry Tan 吐槽 Grok 机器人彻底失联,多平台登录均无回应 — garrytan · 2026-09-17
- Teknium 公开下战书:单次 Agent 会话能否更快更省复刻整个仓库 — Teknium · 2026-09-17