首发意第绪语大模型:高质量语料与多任务基准
Yiddish-NLP · hf · 2026-08-07
Yiddish-NLP 团队发布了 MameLoshnLM,这是首个专门为意第绪语(Yiddish)构建的开源 80 亿参数语言模型。针对意第绪语在网络数字资源匮乏、现有数据集噪声大且多为机器翻译的问题,团队同步推出了高质量预训练语料库 Oytser 和多任务评测基准 Kashes。
研究团队利用这些资源,在 Llama 3.1 8B 的基础上进行持续预训练。在涵盖翻译、语言学分析、信息提取等任务的 Kashes 基准测试中,MameLoshnLM 的表现显著优于同等规模的开源基线模型。
分析表明,该模型不仅在量化指标上领先,还能更好地捕捉意第绪语特有的词汇和形态模式。研究指出,充满噪声的大规模多语言网络数据在处理低资源语言时存在系统性缺陷,而该工作为数字资源匮乏但文化底蕴深厚的语言提供了一个实用的模型开发模板。
「模型」频道最新
- 曝字节正训练 10T 规模推理模型,Seed 团队达 2000 人 — alexvoica · 2026-08-07
- 曝 Qwen 3.8-Max 下周发布:首推 2.4T 参数,27B 随后跟上 — Ok-Shower7286 · 2026-08-07
- 韩国 SK Telecom 发布 688B 参数开源大模型 A.X K2 — huggingface · 2026-08-07
- 英伟达高管:推理模型 Alpamayo 攻克自动驾驶长尾难题 — ZGojcic · 2026-08-07
- DeepSeek-V4-Flash在AMD MI325X上行为异常?用户报告工具调用混乱 — Brunofcsampaio · 2026-08-07
- WeirdML v2 评测发布:任务扩至 19 项,成本与性能呈明显正相关 — yacineMTB · 2026-08-07