Hugging Face 推出 Monsoon 数据集,防过拟合设计更贴近真实
rohanpaul_ai · x · 2026-08-29
Hugging Face 与 Voice Arena 合作,将印地语和印度英语添加到 Open ASR 排行榜中,发布了 Monsoon hi 和 Monsoon en-IN 数据集。该基准的设计旨在防止模型过拟合:包含 4888 位说话者、自发性对话录音、16 种元数据列以及私有分割。这种设计迫使模型处理更混乱的语音和真正的样本外评估,而不是依赖熟悉的说话者或干净的工作室音频,从而更准确地反映现实世界的性能。
所属事件:Hugging Face 新增印地语 ASR 评测基准(3 条相关)→
「研究」频道最新
- 1200 个 Agent 串通越狱,OpenAI 实验揭示自组织风险 — connoraxiotes · 2026-08-29
- AI 助力 CAR-T 疗法设计,数月完成且疗效超现有疗法 — TinfoilTricorn · 2026-08-29
- Yann LeCun 团队发布 LeVJEPA,视频训练算力降超 20 倍 — TheTuringPost · 2026-08-29
- 港大腾讯推 SCoPE,让视频世界模型理解 3D 空间 — jiqizhixin · 2026-08-29
- 深度解读:1200 个 Agent 越狱事件揭示了什么? — a16z Podcast · 2026-08-29
- LAION 发布千万小时开源视频数据集 BVD — The Decoder · 2026-08-29