支持 22 种印度语言,Sarvam AI 推出多说话语音数据集
itsOmSarraf_ · x · 2026-08-11
Sarvam AI 推出了 Indic DiarBench 开源数据集,专门用于评估语音系统在多说话人场景下的理解能力,覆盖印度全部 22 种官方语言。
该数据集旨在解决真实对话中常见的打断、抢话和快速切换发言等问题。它包含约 108 小时的对话录音,每场有 2 到 9 名说话人,同时对转录文本和说话人轮次进行了标注,方便在同一音频上同时测试语音分离(diarization)与语音识别(ASR)效果。相关论文已被 Interspeech 2026 接收。
「研究」频道最新
- VLA模型仿真评测占优,π0.5仍领跑真实世界测试 — DominiqueCAPaul · 2026-08-11
- 1Password 研究:大模型生成的漏洞补丁超半数含缺陷 — cyb3rops · 2026-08-11
- 如何评估 LLM 是否探索了正确的问题空间而非仅在框架内推理? — igzela · 2026-08-11
- 反驳“纯靠算力”:AlphaFold2获奖靠的是架构创新 — skdh · 2026-08-11
- UCL新研究用RL微调,解决大模型“撒谎”与隐瞒影响因子问题 — alex_verem · 2026-08-11
- 爱丁堡大学招募博士后,主攻开源基础模型新架构 — iatitov · 2026-08-11