微软Horvitz等让强模型推理可被弱模型接上,GSM8K行话20步清零

2026-09-05

EACL 2026把可懂性定义成交接鲁棒性:RL rollout随机抽冻结弱模型的token。Llama-2-7B在GSM8K上20步把「≪≫」行话从99%降到0%,测试准确率仍高于弱模型。

这篇在解决什么

模型越强,推理轨迹越难被弱协作者和人接住。可验证奖励的 RL 已经能训出会做题的推理模型,伴随而来的是行话、中英夹杂、过程不可读,DeepSeek-R1-Zero 那类「可读性差、语言混用」就是这条病理。系统提示、示范、专门的可懂性奖励都要事先定义「什么叫好懂」,定义本身脆、易被钻。

微软 Horvitz、Kamar 与 EPFL / 多伦多大学的合作把可懂性收成一个结果标准:交接鲁棒性。强模型(senior)的解对弱模型(junior)可懂,当且仅当在解题路径上随机把控制权交给 junior,任务仍能做完。弱模型不是事后解释,而是共同把题做对。想法来自 Hamade 等人 2024 年在国际象棋里的 tandem training,这里搬到语言模型。

方法

Tandem training 改的是 RL 的 rollout,不改测试时的生成。junior 冻结,只训 senior。

生成时两个模型都在 GPU 上。共享上下文下各自采样下一个 token,当前活跃模型由一个设计粒度决定(这篇主实验用词级)。一个词写完,抛硬币 p=0.5 决定下一个词换不换人;词没写完就继续当前模型。整段 rollout 只有在 senior 和 junior 都没犯致命错时才拿得到奖励,所以优化普通 RL 目标会同时推正确和可接。

主实验用带二元奖励的 REINFORCE:对的 rollout 加大对数似然,错的丢掉。不必告诉优化器两种模型差在技能、格式还是行话,梯度只看 tandem 是否做对。测试时 junior 撤掉,senior 独自答题。作者把它比成 dropout:训练时随机把 senior「静音」,换成更吵的 junior,迫使它别绑死在自己的说话方式上。

结果

域是 GSM8K,模型是 Llama-2-7B 家族。专家模型在训练集上监督微调,测试准确率 39%,对照原版 chat 的 24%。base 模型用英、德、法、保加利亚、塞尔维亚五种语言的系统提示,测试准确率从塞尔维亚语 12% 到英语 24%。训练一个 epoch,词级交接,QLoRA。

三组设置:

设置seniorjunior20 步内的行话准确率落点
技能差英语专家 39%英语 base 24%≪≫ 从 99% 到 0%约 33%,仍高于 junior
技能+语言差英语专家非英 base≪≫ 同样清零;三种语言 50 步内弃用英语全程高于 junior
纯语言差语言 A 的 base语言 B 的 base约 20 步改说 junior 的语言弱者赶上、强者下降但不掉到 junior 以下

对照实验把同一套 RL 只跑在 senior 自己的 rollout 上:≪≫ 行话一直停在 99%,说明清零来自 tandem,不是 REINFORCE。准确率下滑被归因于简单 RL 丢掉错误样本、分布偏向简单题。附录把错误样本以负权重纳入、并把 junior token 软掩码之后,技能差设置的测试准确率留在约 40%,法语言设置留在 30% 以上,行话仍然消失。

为什么重要

可懂性不必写成单独奖励。随机把弱伙伴塞进轨迹,成功本身就要求过程可被接续。对想让推理模型被人审计、或让强弱 agent 共写一条解的人,这是一条能接进现有 RL 管线的正则。和蒸馏相反:这里冻的是弱的,训的是强的。

实验规模很小,Llama-2-7B 在小学算术上的行话消除,还推不到「人类能审超人类模型」。它证明的是机制成立,不是已经解决监督。

局限与存疑

作者列得很清楚:只有 GSM8K;只试了带二元奖励的 REINFORCE;两个模型必须同一套分词器。主实验里准确率明显掉,要靠后来的 (c, j) 超参才补回来,默认配方并不免费。交接是固定 i.i.d. 抛硬币,没有按鲁棒性调度。可接续也可能被误用:两个模型一起训时可能长出对外不可读的私有码,作者建议用人类语言约束和外部校验器锚住。junior 当人类的代理是否成立,这篇没有人机实验。

术语

原文与代码

社区讨论

全部论文解读