测试时也能蒸馏:强模型给弱模型搭脚手架,准确率从 0.49 拉到 0.91

AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses

Cheng Qian, Wenting Zhao, Liangwei Yang, Heng Wang, Jielin Qiu, Heng Ji, Silvio Savarese, Huan Wang, Shelby Heinecke

cs.LG, cs.AI, cs.CL

2026-08-13

让强模型为弱模型搭建推理时脚手架(不改参数),在四个心智理论基准上把目标模型平均准确率从 0.49 拉到 0.91,收益主要来自把不稳定推理卸载到确定性代码。

这篇在解决什么

知识蒸馏通常靠改参数:让大模型当老师,通过 teacher forcing 或 on-policy 蒸馏去更新小模型的权重。这套办法有效但成本高,而且模型一定下来就改不动了。这篇问的是另一个问题:能不能完全不碰小模型的参数,在推理时把强模型的能力「搬」过去?

它的设定是:一个强的 builder 模型(如 GPT-5.5)去搭建一套推理时的 harness(脚手架),可以理解为一层包在目标模型外面的程序逻辑,然后交给一个弱的目标模型(如 GPT-5.4-mini)去答题。builder 只用 5% 的数据当验证集,反复几轮打磨脚手架,最后在完整测试集上评估。

测试场是四个 Theory-of-Mind(心智理论)基准:BigToM、Hi-ToM、MMToM-QA、MuMA-ToM,考的是模型能不能推断智能体的信念、目标、行为。

方法

builder 收到三样东西:任务规则、目标模型的调用示例、那 5% 的验证集。它的工作循环是:提出或修改脚手架代码,在验证集上跑目标模型,看错在哪,再改。跑够了就导出一个推理时的入口。

脚手架本身是这些组件的组合:prompt 模板和 few-shot 示例、按题目子类型分流的路由逻辑、把符号推理交给确定代码来做的求解器、强制输出格式并对答案做校验的检查器。

关键发现不在于脚手架有多复杂,而在于收益来自哪里。主要是把模型不稳定的推理卸载到确定性代码、按基准做子类型路由、强制答案格式这三件事。让它推理得更久或采样更多,贡献很小。真正起作用的是别让模型自由发挥、把它框住。

结果

目标模型 GPT-5.4-mini 的裸分是 0.488,所有脚手架运行的平均分 0.763(提升 0.275),最好的一次跑到 0.912(相对提升 86.7%),已经接近人工设计的脚手架(0.939)。

按基准拆(最好脚手架):

基准脚手架裸分
BigToM1.000.503
Hi-ToM0.8030.569
MMToM-QA0.8420.412
MuMA-ToM0.8570.469

几个规律:越弱的模型获益越大(GPT-5.4-mini 平均涨 0.262,本来就强的 Gemini-3.5-flash 只涨 0.110,在 Hi-ToM 和 MuMA-ToM 上脚手架反而拖后腿);builder 推理越用力脚手架越好,单调上升(Spearman ρ=0.77,低/中/高/超高 effort 分别 0.711/0.793/0.807/0.856);平台效应很小,原生平台平均只多 0.013 且不显著,builder 自身能力才是主因。

为什么重要

对从业者来说,这是一条和改权重互补的路。手里如果有闭源弱模型改不了参数,或者上线后不想重训,可以让一个强模型(哪怕只在离线时用一次)为特定任务搭一套推理脚手架挂上去。门槛低、可复用、零训练成本。

它适用的任务边界也很清楚:适合那些有可复用结构的题,像 ToM 基准里的信念推理可以路由到确定的子逻辑;不适合需要嵌套高阶信念追踪加欺骗的题。它更像把流程性的事固化下来,不是让模型变聪明。

局限与存疑

论文自己承认:最强的脚手架在 Hi-ToM 高阶(递归深度 ≥2)上仍吃力,递归到 4 阶时准确率掉到 0.70;涉及欺骗的场景、MMToM-QA 的贝叶斯目标推断子类、MuMA-ToM 的社会目标类,都没解决。

更值得警惕的是过度脚手架的风险:对本来就不弱的模型,硬套脚手架可能把模型原本能答对的题改错。这套办法依赖基准特定的规则,一条逻辑写错就能让准确率偏移几十个百分点,鲁棒性存疑。重复实验的标准差 0.036,说明流程基本稳定但不是完全确定。

术语

原文与代码

社区讨论

相关论文

全部论文解读