AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses
Cheng Qian, Wenting Zhao, Liangwei Yang, Heng Wang, Jielin Qiu, Heng Ji, Silvio Savarese, Huan Wang, Shelby Heinecke
cs.LG, cs.AI, cs.CL
2026-08-13
让强模型为弱模型搭建推理时脚手架(不改参数),在四个心智理论基准上把目标模型平均准确率从 0.49 拉到 0.91,收益主要来自把不稳定推理卸载到确定性代码。
知识蒸馏通常靠改参数:让大模型当老师,通过 teacher forcing 或 on-policy 蒸馏去更新小模型的权重。这套办法有效但成本高,而且模型一定下来就改不动了。这篇问的是另一个问题:能不能完全不碰小模型的参数,在推理时把强模型的能力「搬」过去?
它的设定是:一个强的 builder 模型(如 GPT-5.5)去搭建一套推理时的 harness(脚手架),可以理解为一层包在目标模型外面的程序逻辑,然后交给一个弱的目标模型(如 GPT-5.4-mini)去答题。builder 只用 5% 的数据当验证集,反复几轮打磨脚手架,最后在完整测试集上评估。
测试场是四个 Theory-of-Mind(心智理论)基准:BigToM、Hi-ToM、MMToM-QA、MuMA-ToM,考的是模型能不能推断智能体的信念、目标、行为。
builder 收到三样东西:任务规则、目标模型的调用示例、那 5% 的验证集。它的工作循环是:提出或修改脚手架代码,在验证集上跑目标模型,看错在哪,再改。跑够了就导出一个推理时的入口。
脚手架本身是这些组件的组合:prompt 模板和 few-shot 示例、按题目子类型分流的路由逻辑、把符号推理交给确定代码来做的求解器、强制输出格式并对答案做校验的检查器。
关键发现不在于脚手架有多复杂,而在于收益来自哪里。主要是把模型不稳定的推理卸载到确定性代码、按基准做子类型路由、强制答案格式这三件事。让它推理得更久或采样更多,贡献很小。真正起作用的是别让模型自由发挥、把它框住。
目标模型 GPT-5.4-mini 的裸分是 0.488,所有脚手架运行的平均分 0.763(提升 0.275),最好的一次跑到 0.912(相对提升 86.7%),已经接近人工设计的脚手架(0.939)。
按基准拆(最好脚手架):
| 基准 | 脚手架 | 裸分 |
| BigToM | 1.00 | 0.503 |
| Hi-ToM | 0.803 | 0.569 |
| MMToM-QA | 0.842 | 0.412 |
| MuMA-ToM | 0.857 | 0.469 |
几个规律:越弱的模型获益越大(GPT-5.4-mini 平均涨 0.262,本来就强的 Gemini-3.5-flash 只涨 0.110,在 Hi-ToM 和 MuMA-ToM 上脚手架反而拖后腿);builder 推理越用力脚手架越好,单调上升(Spearman ρ=0.77,低/中/高/超高 effort 分别 0.711/0.793/0.807/0.856);平台效应很小,原生平台平均只多 0.013 且不显著,builder 自身能力才是主因。
对从业者来说,这是一条和改权重互补的路。手里如果有闭源弱模型改不了参数,或者上线后不想重训,可以让一个强模型(哪怕只在离线时用一次)为特定任务搭一套推理脚手架挂上去。门槛低、可复用、零训练成本。
它适用的任务边界也很清楚:适合那些有可复用结构的题,像 ToM 基准里的信念推理可以路由到确定的子逻辑;不适合需要嵌套高阶信念追踪加欺骗的题。它更像把流程性的事固化下来,不是让模型变聪明。
论文自己承认:最强的脚手架在 Hi-ToM 高阶(递归深度 ≥2)上仍吃力,递归到 4 阶时准确率掉到 0.70;涉及欺骗的场景、MMToM-QA 的贝叶斯目标推断子类、MuMA-ToM 的社会目标类,都没解决。
更值得警惕的是过度脚手架的风险:对本来就不弱的模型,硬套脚手架可能把模型原本能答对的题改错。这套办法依赖基准特定的规则,一条逻辑写错就能让准确率偏移几十个百分点,鲁棒性存疑。重复实验的标准差 0.036,说明流程基本稳定但不是完全确定。