为意第绪语训出首个开源 8B 模型:mC4 里该语种仅 42% 是真货

MameLoshnLM: Yiddish Language Model and Evaluation Benchmark

Uri Katz, Omer Goldman, Tomasz Limisiewicz, Reut Tsarfaty, Noah A. Smith

COLM) 2026

cs.CL, cs.AI

2026-08-06

继续预训练 Llama 3.1 8B 得到首个开源意第绪语模型,在自建 9 任务基准上平均 62.6 分,领先全部同体量开源基线;审计发现 mC4 该语种切片仅 42% 是地道文本。

这篇在解决什么

意第绪语(Yiddish)是一门日耳曼语族语言,用希伯来字母书写,全球约 100 万人使用,词汇里有一层厚厚的希伯来/阿拉米语来源(loshn-koydesh)。它有庞大的文学传统,可一旦上网就几乎隐形:网页规模的多语种语料里,真正的意第绪语少得可怜,而且大多不是真货。

作者直接审了一遍 mC4 这个常用多语种预训练语料里的意第绪语切片,结果很直接:只有 42.2% 是来自可信来源的地道意第绪语,29.8% 是机器翻译的,21.9% 是被语言识别器错判成意第绪语的希伯来语,剩下 6.2% 是杂项碎片。拿来训多语种模型的那部分「意第绪语」,过半是噪声。

后果可以量化:在这样的数据上训出来的多语种模型,能产出听起来流利、却丢了语言核心特征的意第绪语。而这门语言此前既没有专门的语言模型,也没有靠谱的评测基准。

方法

三个东西配套交付:语料 Oytser、基准 Kashes、模型 MameLoshnLM。

Oytser(אוצר,意第绪语「宝库」)是高质量意第绪语预训练语料,915M 词、346.3K 篇文档、5.28B token,来自 9 个来源。最大头是 Yiddish Book Center 的数字图书馆:1.23 万本书、约 7.23 亿词,用 Jochre3 做 OCR,书大多成书于近百年内,覆盖文学、散文、历史多体裁,把意第绪语的长文学传统接进了训练数据。另一半是当代网络原生文本:论坛(Ivelt、Kaveshtiebel,语体更随意、更接近方言)、新闻杂志(Forward、意第绪语维基百科、yiddish.news 等),再加一部希伯来圣经的意第绪语译本。语料用正则做了个人信息脱敏。

Kashes(קאַשעס,「难题」)是配套多任务基准,9 个任务:翻译(自建 Kashes-mt 5287 句对 + FLORES+)、语言学分析(词性标注、依存句法、词形还原、转写)、命名实体识别(EHRI-NER、WikiANN、newNLP)、语言理解(PIQA、WikiQA、PAWS-Wiki)。其中 EHRI-NER 和 newNLP 本是数字人文学者为处理大屠杀证词和历史报纸而建的,评测只是顺便。

模型这边,直接拿 Llama 3.1 8B 继续预训练:5.7B token、36,663 步、单卡 H200 约 207 GPU 小时。数据配比 72% 意第绪语词(占 92% token)、28% 英语。这个配比是有意为之。作者试过把英语预算分一部分给德语、希伯来语、波兰语、俄语这些历史亲属语言,结果并不稳定更好,有些意第绪语核心任务上甚至比未续训的 Llama 还差。结论是强烈的意第绪语主导信号加少量英语,比拉亲属语言进来更有效。

结果

5-shot 下 14 项评测的平均分:

模型平均分
MameLoshnLM62.6
Gemma-2 9B57.0
Llama 3.1 8B56.8
Qwen3 8B54.7
EuroLLM 9B45.6
BLOOMZ 7B20.9

Qwen3 是唯一在文档里明列支持意第绪语的基线。增益集中在意第绪语核心任务上:英译意第绪语 FLORES+ COMET 78.5,比最近的对手高 11 分以上;EHRI-NER 微平均 F1 41.3,对 Llama 的 34.2。泛化类任务也跟得住,WikiANN、WikiQA 接近最好。掉队的两个是 PAWS-Wiki 和 PIQA,它们是 Aya 基准里机翻过来的版本。

比排行榜数字更说明问题的是语言学层面的探针。意第绪语之所以是意第绪语,很大程度靠那层希伯来/阿拉米来源词(loshn-koydesh,LK)。作者测了模型产 LK 词的能力:

探针MameLoshnLMLlama 3.1 8B黄金参考
LK 实词率4.7%1.6%6.2%
LK 句匹配率52.4%16.0%
ge- 过去分词正确率50.85.1
希伯来源复数正确率30.22.3

Llama 产的那点 LK 词还高度集中在专有名词(以色列、拉比、托拉)上,日常词几乎不出。这恰恰和训练数据对得上:机翻的 mC4 页面 LK 率只有 3.6%,地道来源是 10.2%,Llama 的产出甚至跌到机翻文本以下。模型在复刻它见过的那套词法贫乏的意第绪语。

为什么重要

对做低资源语言模型的从业者,这是一份可直接抄的作业:策展语料 + 定向基准 + 继续预训练,单卡 207 GPU 小时就能跑出一个专项语言模型,成本很低,Oytser 和 Kashes 都开源。

对多语种 NLP 这一行,真正的贡献不在模型,在那组审计和探针:它给出了一种可量化的证据,证明网页规模多语种语料对低资源语言是坏的,撑得起表面流利,却在悄悄削弱定义这门语言的特征。这条结论大概率不止适用于意第绪语,凡是网页足迹和真实用法脱节的语言(双言、网上碎片化的语言)都可能踩同样的坑。

得说清楚,这是领域适配加数据工程的结果,不是新架构。价值在数据工作和语言学分析,模型本身没什么新奇。

局限与存疑

模型只恢复了一部分 LK 缺口:4.7% 仍低于地道的 6.2%,没追平母语参考。

许可证是非商业的。Yiddish Book Center 和 In geveb 的机构协议把 MameLoshnLM 锁在非商用许可里,拿去做产品不行。

还没做指令微调。它是个继续预训练后的基础模型,不是对话模型,作者把指令微调列进了未来工作。

翻译指标本身有盲区。作者自己证明 COMET 这个翻译质量指标对 LK 流失几乎不敏感(逐句 LK 召回与 COMET 只有 ρ=0.23 的弱相关)。任何靠 COMET 撑起来的翻译改进都可能藏着词汇层侵蚀,MameLoshnLM 是靠自己的 LK 探针把这点补上的,别的模型未必有人查。

亲属语言混训无效这个结论,是在单次 5.7B token 的设置下得出的,放到更大规模还成不成立,论文没有验证。

术语

原文与代码

相关论文

全部论文解读