Skill Issue: Are Skills Language-Invariant in LLMs?
Bobby Cheng, Adam Gaber, Zhengyuan Liu, Catherine Arnett, Omer Goldman, Cheston Tan, Leshem Choshen
cs.CL, cs.AI, cs.GT, cs.LG
2026-08-26
三家4B模型在八语六游戏上自对弈51.8万局。英语最强、希伯来语最弱;Qwen语言差距约是Gemma两倍。德语井字棋改用英语思考,能追回89.4%缺口。
多语言模型在不同语言上分数不一样,这件事已经测了很多年。已有工作大多盯着知识:同一事实用英语能调出来,换希伯来语就丢。这篇问的是下一层。规则、棋盘、动作空间都固定,只换界面语言,模型会不会连「会不会下棋」都变。
如果技能真跟语言无关,同一模型自己跟自己下,换语言应当接近抛硬币。同语言对同语言的对角线,就是这个对照。
做法是把 TextArena 做成多语言环境,让同一模型的两个副本对弈,各走一种语言。棋盘符号、坐标、牌面、数字和固定动作语法(例如 [bet]、[1])故意不翻译,保证规则和合法动作一致。变的只有指令和观测文本。
实验用了三家体量接近的开源指令模型:Gemma-4-E4B-it、Qwen3-4B、Ministral3-3B-Instruct-2512。八种语言由母语者核对:英、阿、德、西、法、希伯来、马来、中文。六款游戏覆盖空间推理(井字棋、SimpleTak)、完全信息组合博弈(Nim)、同时资源配置(Colonel Blotto)、不完美信息(Kuhn Poker)和重复互动(迭代囚徒困境)。
每种语言对、两个座位各打 400 局,温度 1.0。非法动作给一次改错机会,再错直接判负。三个模型 × 六款游戏合计 51.84 万局。主指标是角色对消后的胜负差 Δ = (胜 − 负) / 总局数,再对其余七种语言取平均,得到每种语言的实力 μ。仓库另有 65 款游戏、193 种语言的分层翻译,正文数字只用这 6×8 的人工核对子集。
三家模型都是英语整体最强、希伯来语整体最弱。Gemma 最稳,Qwen 的语言阶梯最陡。中文并不是处处落后:Qwen 在 Nim 和 Blotto 上的中文 μ 还高于英语。
语言敏感度用 max μ − min μ 衡量:
| 模型 | Blotto | Nim | 井字棋 | SimpleTak | 囚徒困境 | Kuhn | 平均 |
| Gemma | 0.44 | 0.02 | 0.47 | 0.43 | 0.25 | 0.05 | 0.28 |
| Qwen | 1.48 | 0.85 | 0.32 | 0.44 | 0.03 | 0.13 | 0.54 |
| Ministral | 1.28 | 0.49 | 0.36 | 0.28 | 0.74 | 0.20 | 0.56 |
Colonel Blotto 对语言最敏感(三家平均 1.07),Kuhn Poker 最不敏感(0.13)。Qwen 在 Blotto 上 1.48 的跨语言鸿沟,已经接近「换一种语言等于换了一个对手」。
失败方式也随语言变。Gemma 用英语下井字棋,输在行 / 列 / 对角的比例是 28.5% / 34.8% / 36.7%,比较均衡;换成阿拉伯语就变成 20.3% / 34.4% / 45.3%,对角漏洞变大。SimpleTak 同样:英语输在行 53.2%、列 46.8%;阿拉伯语和希伯来语都是 42.8% / 57.2%,更吃列方向的亏。文本按行序列化,列和对角本来就更难盯,弱语言把这个偏科放大了。
Kuhn Poker 里,Qwen 用最弱牌 J 去诈的比例,西班牙语 22.5%、阿拉伯语 47.4%,差一倍还多。Gemma 对明确强弱牌更稳,波动主要出在中间牌 Q:马来语下注 41.6%,希伯来语 63.3%。Ministral 的非法动作率从英语 9.3% 升到希伯来语 20.9%,拿到 K 还弃牌的比例在 10.4%–23.7%。
Nim 有教科书解法(把 Nim-sum 做成 0)。Gemma 几乎不吃语言:各语言胜率贴着 50%,最优首招执行率 99% 以上,语言差距只有 0.02。Qwen 完全两回事。英语胜率 61.0%、最优首招 80.8%;希伯来语 42.7% / 4.0%;阿拉伯语 32.4% / 10.5%。中文反而是 Qwen 最强的 Nim 界面,胜率 69.8%、最优首招 74.3%。Ministral 在希伯来语日志里只出现 2,753 次最优策略提及,英语是 538,093 次;阿拉伯语里 70%、希伯来语里 50% 的策略提及,来自模型自己切到拉丁字母再推理(这类切语言分别只占 3.7% 和 1% 的对局)。知识在权重里,弱语言界面经常调不出来。
把界面留在弱势语言、只改中间推理语言,井字棋和 SimpleTak 能追回大半。Gemma 德语井字棋 μ = −0.22,改用英语思考变成 +0.20,追回相对英语天花板的 89.4%;SimpleTak 从 −0.21 到 +0.05,追回 60.5%。Kuhn Poker 同样操作只追回约 37%–49%。语言卡在决策的不同阶段,不能指望一律先改思考语言就修好。
语言实力 μ 和 Belebele 准确率的相关系数 r 在 0.71–0.79,和 5-shot Global MMLU 在 0.73–0.92,和 FineWeb-2 网页词量(英语用 FineWeb 估)平均 r = 0.79。静态榜能解释谁强谁弱,解释不了稳不稳:Gemma 的 Global MMLU 均值最低(49.9),跨语言跨度却最小(0.28);Qwen 均值最高(61.9),跨度几乎翻倍(0.54)。马来语网页比希伯来语少,三家模型里马来语都更强,和「同文字系统更好迁移」的既有结论一致。中文网页量大约是英语的 1/20,Qwen 和 Ministral 的中文 μ 仍接近英语,Gemma 的中文总体接近零。数据量和文字系统各解释一块,剩下的是模型自己的实现差异。
做多语言 agent 或任何要按规则行动的产品,不能只看翻译后的 MMLU。同一个 4B 模型,换界面语言就会改风险偏好、改空间漏洞、改能不能调出已知算法。英语思考作为补丁,在空间游戏上很有效,在信息不完美的牌局里没那么灵。
对训练的含义更硬。平均分高不等于跨语言行为一致。Gemma 知识榜更低,下棋却更不偏科。若产品要覆盖希伯来语、阿拉伯语这类文字系统,光堆数据量可能不够,还得测交互策略本身。
这是渐进测量工作,不是新算法。价值在把「技能会不会随语言变」从印象变成可复现的对弈实验,并放出 193 语的环境扩展。
作者自己写了两条。训练数据配方不公开,语言差距只能拿网页存量当代理;试过数据公开的 Apertus,非法动作太多,分打不出来。实验锁在 3B–4B,51 万局打得起,更大模型会不会抹平这套差距,没有证据。
另外几处论文没强调。动作语法故意留了英语括号指令,弱语言还要夹着 [bet] 输出,非法动作率可能被格式拖累,不完全是棋力。翻译先由 Claude Opus 4.8 或 GPT-5.2 生成再人工核对,界面质量仍可能有残差。自对弈测的是相对语言差,不是绝对棋力;对人类或更强模型会不会换排名,没测。八种语言、六款抽象游戏,覆盖不到需要文化知识或长程工具使用的技能。温度 1.0 也让轨迹更散,同一设置换 greedy 解码差距会不会收窄,正文没报。