换种子晃7.7分,希腊语SFT把推理痕迹从0拉到98%

Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See

Ayoub Kirouane, Christos Petrocheilos

cs.CL, cs.LG, cs.RO, stat.ML

2026-08-18

三家3.6–4.0B激活的前沿MoE做同一套希腊语推理SFT后,准确率几乎不动,换种子却能晃7.7分。基座0条希腊语痕迹,SFT后约98%跟问题语言走;RLVR把格式失败从24.1%压到2.5%。

这篇在解决什么

低资源语言的推理微调,交差方式几乎总是一个准确率数字。希腊语这边已经有 Meltemi、Krikri 这类指令模型,也能用希腊语作答,但没有公开检查点会把推理过程用希腊语写出来,也没有基准能把「用希腊语想」和「用英语想完再翻译」分开。

Sophea AI / KIEFER 把约束钉在服务账单上:激活参数卡在 3.6–4.0B,总参数可以差 1.7 倍。三家前沿稀疏 MoE 用同一套语料和仪器过一遍,阿里 Qwen3.6-35B-A3B、OpenAI gpt-oss-20B、NVIDIA 两代 Nemotron,用来把配方效应和架构效应拆开。准确率几乎不动,这是第一条结果。真变化落在准确率看不见的地方。

方法

语料 118,092 行,对半切。推理半边 59,107 行,98.5% 是合成痕迹:题目和金标来自公开英语数据,痕迹用商业模型在希腊语里重新解一遍,答案对不上金标就丢掉,不修补。直接半边 58,985 行复用已发布的 Sophea-Titan-1 指令语料,约 9% 英语故意留着防遗忘。

适配是 LoRA,r=32,α=64,一轮,有效 batch 32。MoE 上专家步长 3,共享专家始终挂适配器。训练、合并、评测全压在单台 8×B200 上,这是给低资源社区定的可复现上限。

六个行为维度比准确率先定义:正确性、语言保真、推理预算、是否截断、中间结论步数、简单题上是否空转。预算用词数而不是 token,因为希腊语每个词要付 2.3–2.5 倍 token。答案没吐出约定行,单独记 fallback%,把「不会推理」和「不按格式收尾」拆开。语言匹配修好之后,SFT 修不动的格式病交给预注册的 RLVR:四条臂只差奖励项,其中一条纯随机奖励,用来一票否决「看起来像学到了、其实只是诱发」。

结果

准确率这条线几乎是空的。同一套推理-only 配置只换种子,分数 76.4 / 76.2 / 68.7,极差 7.7 分,比项目里测过的所有数据和配方效应都大。按结构分筛选的 15,607 行和同等规模随机抽样打成 69.5 对 69.0。基座在 1,000 条希腊题上 0 条用希腊语推理,5,156 条全量同样是 0;SFT 之后四个发布检查点 97.4–98.1% 的痕迹跟问题语言走。

指标基座SFT 后
希腊语痕迹保真0/515697.4–98.1%
Qwen 中位 token1788586,少 3.0 倍
简单题预算超支98.0%0.2–12%
语法(最弱基座 NemotronH)13/5827/57

token 账按家族变号。Qwen 少 3 倍,NemotronH 打平,Gpt-OSS 的希腊痕迹比它惜字的英语基座贵 1.6 倍。单向语料会把「请用英语想」锁死到 0/1000;改成语言匹配对之后,问题语言默认跟住,显式覆盖只在 Qwen(44.8%)和 Gpt-OSS(62.5%)上重开,两个 Nemotron 仍是 0%。

SFT 修不好自己种下的格式病。Qwen 有 24.1% 不按约定行收尾,3.53% 答案漏进推理通道。预注册 RLVR 把这两桩按掉:fallback 24.1%→2.5%,leak 3.53%→0.00%。随机奖励对照停在 22.1% 和 3.61%。「用英语想」的指令服从 +9.1 个百分点(44.8%→53.9%),过了对照,没摸到预注册的 +15pp / 60% 门槛。只喂准确率、不保护语言的那条臂,希腊语保真仍是 98.22%。

Titan-1 套件上 Qwen 希腊/英语宏几乎持平(-0.01 / +0.08)。Gpt-OSS 修完格式后希腊还亏 3.2 点。没有任何微调臂在希腊推理基准上打赢自家基座。

为什么重要

给低资源语言做推理模型的人,这篇把「分不动」从失败改写成测量学结论:你要的东西准确率看不见。语言匹配、预算是否跟难度走、格式是否听话,这三件事种子几乎不动;准确率在同一扰动下散开。

工程上能拿走的是配方分工。SFT 负责把思考语言装进去;格式和通道泄漏用可验证奖励修,别再堆语料。五个检查点已发布。工具、对照和预注册声明可以换语言复用,希腊语只是他们测得动的那一个。

局限与存疑

所有模型都是稀疏 MoE 加 LoRA,没有稠密对照,种子敏感可能被路由放大。噪声地板只在 Qwen 一条配置上用三个种子估过。希腊语是欧盟官方语言、有专用开源模型,配方能不能落到真正低资源语言没测。除了约 150 条手工标语言切换,保真全是自动脚本身份,没有人读痕迹是否跟得上。没比过「把英语痕迹事后翻译」和 few-shot 希腊语示范。RLVR 只在 Qwen 一族、每臂一种子上跑过,覆盖指令没摸到 60%。逻辑轴三类里 False 的召回全线只有 14–16%,单一准确率会把这件事藏起来。

术语

原文与代码

相关论文

全部论文解读