YODAS v3 发布:110万小时语音数据,史上最大开源音频数据集

shinjiw_at_cmu · x · 2026-09-28

ESPnet 团队在 Hugging Face 发布 YODAS v3,规模达 110 万小时,是迄今最大的开源音频数据集,也是首个在此规模上提供 48kHz 立体声的资源,附带带时间戳的转写和翻译文本,覆盖 100+ 种语言,采用 CC-BY-3.0 许可。

作者指出,训练数据才是当前 AI 研究的真正胜负手:Whisper 等顶尖语音系统都建立在庞大且多样的专有音频库之上,开放社区最大的短板正是缺乏同规模数据。此前的开源资源如 LibriLight(约 6 万小时英语)和 Multilingual LibriSpeech(8 语言)多取自有声书朗读,与真实对话风格相去甚远;VoxPopuli 虽多语但仅小部分有转写。YODAS 系列正是为填补这一空白而生,旨在支撑下一代开放语音 AI 研究。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →