YODAS v3 发布:110万小时语音数据,史上最大开源音频数据集
shinjiw_at_cmu · x · 2026-09-28
ESPnet 团队在 Hugging Face 发布 YODAS v3,规模达 110 万小时,是迄今最大的开源音频数据集,也是首个在此规模上提供 48kHz 立体声的资源,附带带时间戳的转写和翻译文本,覆盖 100+ 种语言,采用 CC-BY-3.0 许可。
作者指出,训练数据才是当前 AI 研究的真正胜负手:Whisper 等顶尖语音系统都建立在庞大且多样的专有音频库之上,开放社区最大的短板正是缺乏同规模数据。此前的开源资源如 LibriLight(约 6 万小时英语)和 Multilingual LibriSpeech(8 语言)多取自有声书朗读,与真实对话风格相去甚远;VoxPopuli 虽多语但仅小部分有转写。YODAS 系列正是为填补这一空白而生,旨在支撑下一代开放语音 AI 研究。
「研究」频道最新
- hardmaru《神经进化》教科书出版,免费在线版开放 — hardmaru · 2026-09-28
- 四套从零构建教程合集:手写 LLM、复现 DeepSeek 与扩散模型 — caglar_ee · 2026-09-28
- Hillock 开源引擎:用三元组+Hebbian 权重替代向量库,1.2GB 显存跑本地 agent 记忆 — Equivalent-Flan-1590 · 2026-09-28
- 北大开源 RayOrch:数据准备管线最高提速 15.14 倍 — PekingUniversity · 2026-09-28
- 「图对齐就是你所需要的」报告登陆 CIRM 图论研讨会 — marc_lelarge · 2026-09-28
- AI 挑出"不靠谱"材料,催化剂抗酸超千小时 — VraserX · 2026-09-28