Hugging Face 推出 Monsoon 数据集,防过拟合设计更贴近真实

rohanpaul_ai · x · 2026-08-29

Hugging Face 与 Voice Arena 合作,将印地语和印度英语添加到 Open ASR 排行榜中,发布了 Monsoon hi 和 Monsoon en-IN 数据集。该基准的设计旨在防止模型过拟合:包含 4888 位说话者、自发性对话录音、16 种元数据列以及私有分割。这种设计迫使模型处理更混乱的语音和真正的样本外评估,而不是依赖熟悉的说话者或干净的工作室音频,从而更准确地反映现实世界的性能。

所属事件:Hugging Face 新增印地语 ASR 评测基准(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →