MameLoshnLM: Yiddish Language Model and Evaluation Benchmark
Uri Katz, Omer Goldman, Tomasz Limisiewicz, Reut Tsarfaty, Noah A. Smith
COLM) 2026
cs.CL, cs.AI
2026-08-06
继续预训练 Llama 3.1 8B 得到首个开源意第绪语模型,在自建 9 任务基准上平均 62.6 分,领先全部同体量开源基线;审计发现 mC4 该语种切片仅 42% 是地道文本。
意第绪语(Yiddish)是一门日耳曼语族语言,用希伯来字母书写,全球约 100 万人使用,词汇里有一层厚厚的希伯来/阿拉米语来源(loshn-koydesh)。它有庞大的文学传统,可一旦上网就几乎隐形:网页规模的多语种语料里,真正的意第绪语少得可怜,而且大多不是真货。
作者直接审了一遍 mC4 这个常用多语种预训练语料里的意第绪语切片,结果很直接:只有 42.2% 是来自可信来源的地道意第绪语,29.8% 是机器翻译的,21.9% 是被语言识别器错判成意第绪语的希伯来语,剩下 6.2% 是杂项碎片。拿来训多语种模型的那部分「意第绪语」,过半是噪声。
后果可以量化:在这样的数据上训出来的多语种模型,能产出听起来流利、却丢了语言核心特征的意第绪语。而这门语言此前既没有专门的语言模型,也没有靠谱的评测基准。
三个东西配套交付:语料 Oytser、基准 Kashes、模型 MameLoshnLM。
Oytser(אוצר,意第绪语「宝库」)是高质量意第绪语预训练语料,915M 词、346.3K 篇文档、5.28B token,来自 9 个来源。最大头是 Yiddish Book Center 的数字图书馆:1.23 万本书、约 7.23 亿词,用 Jochre3 做 OCR,书大多成书于近百年内,覆盖文学、散文、历史多体裁,把意第绪语的长文学传统接进了训练数据。另一半是当代网络原生文本:论坛(Ivelt、Kaveshtiebel,语体更随意、更接近方言)、新闻杂志(Forward、意第绪语维基百科、yiddish.news 等),再加一部希伯来圣经的意第绪语译本。语料用正则做了个人信息脱敏。
Kashes(קאַשעס,「难题」)是配套多任务基准,9 个任务:翻译(自建 Kashes-mt 5287 句对 + FLORES+)、语言学分析(词性标注、依存句法、词形还原、转写)、命名实体识别(EHRI-NER、WikiANN、newNLP)、语言理解(PIQA、WikiQA、PAWS-Wiki)。其中 EHRI-NER 和 newNLP 本是数字人文学者为处理大屠杀证词和历史报纸而建的,评测只是顺便。
模型这边,直接拿 Llama 3.1 8B 继续预训练:5.7B token、36,663 步、单卡 H200 约 207 GPU 小时。数据配比 72% 意第绪语词(占 92% token)、28% 英语。这个配比是有意为之。作者试过把英语预算分一部分给德语、希伯来语、波兰语、俄语这些历史亲属语言,结果并不稳定更好,有些意第绪语核心任务上甚至比未续训的 Llama 还差。结论是强烈的意第绪语主导信号加少量英语,比拉亲属语言进来更有效。
5-shot 下 14 项评测的平均分:
| 模型 | 平均分 |
| MameLoshnLM | 62.6 |
| Gemma-2 9B | 57.0 |
| Llama 3.1 8B | 56.8 |
| Qwen3 8B | 54.7 |
| EuroLLM 9B | 45.6 |
| BLOOMZ 7B | 20.9 |
Qwen3 是唯一在文档里明列支持意第绪语的基线。增益集中在意第绪语核心任务上:英译意第绪语 FLORES+ COMET 78.5,比最近的对手高 11 分以上;EHRI-NER 微平均 F1 41.3,对 Llama 的 34.2。泛化类任务也跟得住,WikiANN、WikiQA 接近最好。掉队的两个是 PAWS-Wiki 和 PIQA,它们是 Aya 基准里机翻过来的版本。
比排行榜数字更说明问题的是语言学层面的探针。意第绪语之所以是意第绪语,很大程度靠那层希伯来/阿拉米来源词(loshn-koydesh,LK)。作者测了模型产 LK 词的能力:
| 探针 | MameLoshnLM | Llama 3.1 8B | 黄金参考 |
| LK 实词率 | 4.7% | 1.6% | 6.2% |
| LK 句匹配率 | 52.4% | 16.0% | — |
| ge- 过去分词正确率 | 50.8 | 5.1 | — |
| 希伯来源复数正确率 | 30.2 | 2.3 | — |
Llama 产的那点 LK 词还高度集中在专有名词(以色列、拉比、托拉)上,日常词几乎不出。这恰恰和训练数据对得上:机翻的 mC4 页面 LK 率只有 3.6%,地道来源是 10.2%,Llama 的产出甚至跌到机翻文本以下。模型在复刻它见过的那套词法贫乏的意第绪语。
对做低资源语言模型的从业者,这是一份可直接抄的作业:策展语料 + 定向基准 + 继续预训练,单卡 207 GPU 小时就能跑出一个专项语言模型,成本很低,Oytser 和 Kashes 都开源。
对多语种 NLP 这一行,真正的贡献不在模型,在那组审计和探针:它给出了一种可量化的证据,证明网页规模多语种语料对低资源语言是坏的,撑得起表面流利,却在悄悄削弱定义这门语言的特征。这条结论大概率不止适用于意第绪语,凡是网页足迹和真实用法脱节的语言(双言、网上碎片化的语言)都可能踩同样的坑。
得说清楚,这是领域适配加数据工程的结果,不是新架构。价值在数据工作和语言学分析,模型本身没什么新奇。
模型只恢复了一部分 LK 缺口:4.7% 仍低于地道的 6.2%,没追平母语参考。
许可证是非商业的。Yiddish Book Center 和 In geveb 的机构协议把 MameLoshnLM 锁在非商用许可里,拿去做产品不行。
还没做指令微调。它是个继续预训练后的基础模型,不是对话模型,作者把指令微调列进了未来工作。
翻译指标本身有盲区。作者自己证明 COMET 这个翻译质量指标对 LK 流失几乎不敏感(逐句 LK 召回与 COMET 只有 ρ=0.23 的弱相关)。任何靠 COMET 撑起来的翻译改进都可能藏着词汇层侵蚀,MameLoshnLM 是靠自己的 LK 探针把这点补上的,别的模型未必有人查。
亲属语言混训无效这个结论,是在单次 5.7B token 的设置下得出的,放到更大规模还成不成立,论文没有验证。