把 FLORES 改写成 27 个本地化版本,照出翻译模型过拟合与美国中心偏好

Cultivar: A Contrastive and Locale-Oriented Translation Benchmark for Investigating Contamination and Localisation Robustness

Pinzhen Chen, Koel Dutta Chowdhury, Xiaoya Xu, David Tan, Doreen Osmelak, Ona de Gibert, Ariun-Erdene Tumurchuluun, Ashok Urlana, Fedor Sizov, Hale Sirin, Jesujoba Alabi, Karrar Talib Abed, Mateusz Klimaszewski, Nikolay Bogoychev, Niyati Bafna, Patricia Schmidtova, Preksha Manjunath Shanbhag, Sherrie Shen, Vilem Zouhar, Vivek Iyer, Yasser Hamidullah, Yusser Al Ghussin, Zheng Zhao

cs.CL, cs.AI

2026-08-10

用 27 个地区的本地化版 FLORES 对照评测 32 个翻译模型,发现翻译专用模型对本地化内容掉分最多,两个强模型疑似过拟合 FLORES,且模型普遍更会翻译美国内容。

这篇在解决什么

机器翻译评测有个长期被默认接受的设定:测试集几乎都从英文出发,再翻译成几百种语言(FLORES、NTREX、WMT24++ 都这样)。这么做有两个隐患。第一,英文原文是公开的,模型在训练时可能已经见过,分数被污染抬高了。第二,真实场景里,把一段印地语翻成英语,这段印地语通常是母语者原生写的,而不是从某条英文新闻翻译过来的;拿英文翻译体文本当输入,评测和真实用途是错位的。

还有一个被忽略的维度:同一种语言在多个地区使用。中文在中国、新加坡、美国华人社区面貌各异;印地语在印度之外,也分布在德国、美国的移民群体里。把一种语言当成单一文化背景来测,等于把地区差异这笔账糊掉了。

Cultivar 就是冲着这两点来的:既要做「源头对照」评测,把同一句话放进不同地区背景,看模型分数怎么动;也要做「地区导向」评测,把同一种语言的多个地区版本分开测。

方法

Cultivar 建在 FLORES 的开发集上,三步走:

最终得到 27 个「语言-文字-地区」组合(21 种语言、8 种文字、21 个国家或地区),每个地区 200 条。整套数据 98% 以上是新改写的本地化内容,标注员平均直接采纳 70% 的 LLM 输出。这一步只做了「任意语言→英语」方向。

关键设计在于「保留句子结构、只换实体」。这样原版和本地化版之间只差地区内容一项,模型分数的落差就能干净地归因到对地区内容的鲁棒性上,而不是翻译能力本身。论文定义了 ∆BLEU = 本地化分数 − 原版分数:∆ 越偏负,说明模型一遇到本地化内容就掉链子。这个量与模型整体翻译好坏近乎无关,因为一个翻得差的模型在两版上都差,∆ 反而接近 0。

结果

在 32 个开源模型(0.8B 到 122B,可跑在两块 A100 80GB 上)上测出三轮发现。

第一,Cultivar 和原版 FLORES 给出的模型排名高度一致:Spearman rs 平均 ≥ 0.98。本地化并没有改变谁强谁弱的大格局。

第二,排名没变,绝对分数却变了。多数模型的 ∆BLEU 落在 −2 到 +2 之间,平均 −0.49。但有两类模型明显偏负。一是翻译专用模型,无论传统 MT(NLLB、MADLAD)还是专门为翻译微调的 LLM(Hy-MT2 全系、Seed-X-PPO-7B),∆ 都集中在负区,Hy-MT2 三个尺寸分别是 −2.06、−2.16、−2.28。二是两个最强选手栽得最狠:

模型原版 BLEU本地化 BLEU∆BLEU
Seed-X-PPO-7B53.1845.64−9.68
aya-expanse-8b50.5144.50−8.87

这两个模型在 FLORES 上能赢过 Llama-3.3-70B 和 Qwen3.5-122B,换到 Cultivar 上分数却塌了。论文用「假阳性」(翻译里不该再出现、已在本地化时被删掉的原版 FLORES 词汇)查逐字记忆,绝大多数模型低于 1%,掉分最多的这两个也没有显著偏高。所以没有它们背过 FLORES 原文的直接证据,但分数落差本身就指向对 FLORES 题域、风格或句式结构的过拟合。

第三,模型越大越扛得住本地化。8 个模型族里有 6 个 ∆ 随参数量上升而上升。这意味着 FLORES 可能低估了强模型真正的多语能力。

第四,地区有难易。最难的是 cmnHansSingapore(∆BLEU −4.29),其次是叙利亚阿拉伯语、日语、蒙古语;最易的是马拉加西语(马达加斯加)和孔卡尼语(印度)。论文还针对印地语和中文,各做了一次「同语言、不同地区」的对照:两者都本地化到了非母语地区(印地语到美国、德国,中文到美国、英国)。结果一致,不管源语言是印地语还是中文,模型都把美国本地化的内容翻得最好,翻中国、新加坡的内容更差。这是一种训练数据里的美国中心偏好,Cultivar 第一次给了系统探测它的办法。

人工错误分析(中文→英语,三个地区)印证了上面:命名实体错误占了地区相关错误的八成以上、全部错误的一半以上;拼音转写错误只出现在中国版本(占该版本错误的 20%),因为中文名要罗马化;度量单位错误在英国(22 处)、中国(14 处)远多于美国(5 处),涉及斤、英镑、世纪换年代这类。

为什么重要

对做翻译或评测的人来说,这篇给了一个便宜的诊断工具。一次对照实验就能看出:一个高分模型到底是真本事,还是吃准了某个公开测试集的口味。Seed-X-PPO-7B 那种「错误数和 Qwen3.5-9B 差不多、BLEU 却高出一截」的错配,靠传统单一测试集是看不出来的。

对应用方来说,如果你的翻译场景涉及非英语母语的真实内容(绝大多数情况都是),FLORES 类基准的分数要打个折扣看,尤其要留意模型在目标地区内容上的表现,而不是只看整体 BLEU。

对训练多语模型的人来说,翻译专用模型反而在本地化上更脆,这个反直觉的结论值得重视:为翻译任务做的强化,可能让模型把分布收窄到了公开测试集的样子,牺牲了对文化内容的泛化。

局限与存疑

论文自己也点了几条。Cultivar 目前只做了「→英语」一个方向,「英语→X」和「X→Y」还没覆盖。本地化内容由单个标注员完成,可能带入个人偏好,某个地区偏难偏易未必纯粹是模型问题,也可能是数据本身的痕迹。

「FLORES 过拟合」的结论是间接的:没有逐字记忆的直接证据,是从分数落差和「错误数与 BLEU 不匹配」推断出来的,论文用了「可能」「指向」这样的措辞。假阴性率也只算本地化失败的上界,不是精确错误率,因为同一概念本就可以有多种合理译法。同语言不同地区的小规模消融只做了印地语和中文两种,样本有限。

读下来还有一处没完全说透:论文把翻译专用模型 ∆ 偏负归因到「为翻译微调导致分布收窄」,但没有给出消融或训练数据层面的佐证,目前更像一个合理的假设。

术语

原文与代码

相关论文

全部论文解读