首发意第绪语大模型:高质量语料与多任务基准

Yiddish-NLP · hf · 2026-08-07

Yiddish-NLP 团队发布了 MameLoshnLM,这是首个专门为意第绪语(Yiddish)构建的开源 80 亿参数语言模型。针对意第绪语在网络数字资源匮乏、现有数据集噪声大且多为机器翻译的问题,团队同步推出了高质量预训练语料库 Oytser 和多任务评测基准 Kashes。

研究团队利用这些资源,在 Llama 3.1 8B 的基础上进行持续预训练。在涵盖翻译、语言学分析、信息提取等任务的 Kashes 基准测试中,MameLoshnLM 的表现显著优于同等规模的开源基线模型。

分析表明,该模型不仅在量化指标上领先,还能更好地捕捉意第绪语特有的词汇和形态模式。研究指出,充满噪声的大规模多语言网络数据在处理低资源语言时存在系统性缺陷,而该工作为数字资源匮乏但文化底蕴深厚的语言提供了一个实用的模型开发模板。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →