OPD2 蒸馏多语言数学推理:韩日效果稳超 OPD,但纯英文训练会让模型改用英文作答

On-Policy Delta Distillation for Multilingual Math Reasoning

Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han

cs.CL, cs.LG

2026-08-06

NAVER 把 OPD2 蒸馏用于英、韩、日数学推理,Qwen3 上稳定超过原版 OPD,韩日语提升尤其明显;但纯英文蒸馏虽然也能涨分,代价是模型常常不再用提问语言作答。

这篇在解决什么

在线策略蒸馏(OPD)是强化学习之外做 LLM 后训练的一条路:学生模型自己生成回答,教师模型给出 token 级概率,学生去对齐教师。它比 RL 的整段序列级监督更密、更省。OPD2 是它的改进版,把学习信号换成「教师与其基座模型的概率差」,意在只蒸馏后训练获得的推理能力,不被基座已有的通用偏好和风格带偏。

这套东西在英语上验证过,但在多语言、尤其是东亚语言(韩语、日语)上几乎没人系统测过。NAVER 这篇就是补这个空缺,问三个问题:OPD2 在多语言下还赢 OPD 吗?它能不能缩小英语和非英语的性能差?只用英文蒸馏会怎样?

方法

实验用 Qwen3-1.7B 和 Qwen3-8B 当学生,Qwen3-30B-A3B-2507 当教师。OPD 的目标让学生对齐教师整个输出分布;OPD2 把奖励定义成教师的对数概率减去教师基座的对数概率,隔离出后训练才获得的那部分能力。还配了奖励中心化和基于原始 OPD 信号的条件判据来解决 delta 信号的收敛点问题。评测覆盖 PolyMath、Global-MGSM(英、韩、日)、HRM8K(英、韩)、MAWPS(日),分思考模式和非思考模式。

结果

OPD2 在多语言下稳定胜过原版 OPD,韩日语提升尤其明显。

学生模型英语 OPD→OPD2韩语日语
Qwen3-1.7B60.5→63.6OPD→OPD2 +3.1OPD→OPD2 +4.0
Qwen3-8B+0.7+3.3+3.1

OPD2 相对基座也有实打实的提升:1.7B 上英语从 55.1 涨到 63.6、韩语 40.9 到 51.9、日语 37.2 到 52.0;8B 上英语从 62.8 到 70.5。它还缩小英韩差距:PolyMath 上从 6.4 降到 5.0,Global-MGSM 从 13.4 降到 9.3,HRM8K 对 GSM8K 从 12.1 降到 9.2,七个基准里六个差距收窄。

真正有意思的是纯英文训练的对照。只用英文跑 OPD2 蒸馏,韩语和日语的准确率居然也涨,非思考模式下甚至和用多语言训练差不多。但准确率会骗人。作者量了「目标语言回答率」,即输出语言是否匹配提问语言:多语言训练的非思考模式韩语、日语回答率分别是 90.5% 和 90.9%,纯英文训练直接掉到 48.3% 和 29.6%;思考模式的最终答案也类似,从 97.6%/95.2% 掉到 36.1%/30.8%。

为什么重要

它把两件常被混为一谈的事拆开了:跨语言推理能力的迁移,和目标语言的生成保持。蒸馏能把英语里学到的推理迁移到韩日语(准确率涨),但保证不了模型真的用韩日语作答(纯英文训练下它常常偷偷切回英文)。光看基准准确率会高估多语言能力,必须同时看回答语言。

对做多语言后训练的人,这是个很实用的提醒:别只盯分数。OPD2 在多语言场景上确实有效,但纯英文训练的「涨分」里有一块是语言偏移撑起来的假象。

局限与存疑

范围窄。只测了英、韩、日三种语言,而且只测数学推理。数学是符号化、语言无关性较强的领域,推理能跨语言迁移这个结论,未必能推到问答、写作这类更依赖语言本身的任务上。

只用了一个模型家族(Qwen3)和一个教师,OPD2 本身是作者前作的工作,这篇是经验性扩展研究,没有提出新方法。作者也承认缩小英韩差距「并非在所有模型和设置上都一致」。思考模式里中间推理几乎全是英文,只统计 </think> 之后的语言,这个测量口径本身就反映了模型内部语言使用的不一致。

术语

原文与代码

相关论文

全部论文解读