Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills
Agamdeep Singh, Srishti Gautam, Priyanshu Gupta, Nikita Mehrotra, Tanmay Bakshi, Sumit Gulwani
COLM 2026 Efficient Reasonin
cs.AI
2026-08-08
让编程 agent 把任务轨迹里反复出现的操作提炼成技能,注入非推理模型提示词;四个 agent 基准恢复 55%-100%+ 推理增益,token 只花 1/6。
推理模型在多步 agent 任务上比非推理模型强,但代价是每条任务多吐 2.7-6 倍的输出 token,其中不少花在反复推导同一类操作上,每次部署都要重新想一遍「先查邮箱、再调接口」这种流程。这笔钱按调用次数线性计,跑得越多越亏。
微软这群人(Sumit Gulwani 团队)的观察是:同一个领域里,这些被反复推导的过程其实是共享的、跨任务不变的知识。既然如此,就该提取一次反复用,而不是每次都让模型从头想。
方法叫「被动技能蒸馏」(passive skill distillation),三步:
关键在于它蒸馏的是过程性知识,不是参数:一段自然语言规则,对人可读、可改,任何能改 prompt 的模型都能用。
GPT-5.4-mini 在四个 agent 基准上(成功率 / 平均输出 token):
| 基准 | 推理 | 非推理 | 非推理+技能 |
| ALFWorld | 0.713 / 3723 | 0.567 / 952 | 0.787 / 832 |
| SpreadsheetBench-Verified | 0.613 / 3291 | 0.447 / 960 | 0.560 / 831 |
| τ²-telecom | 0.450 / 2143 | 0.192 / 421 | 0.333 / 597 |
| τ²-retail | 0.350 / 1615 | 0.325 / 536 | 0.408 / 565 |
ALFWorld 和 retail 这两个,非推理加技能直接超过了推理模式,token 还少 3-4.5 倍。整体上技能恢复了推理模式 55%-100%+ 的增益,而推理 token 一个都不用花。
换到 Qwen3.6-27B 上差距更大:ALFWorld 推理 0.773,非推理加技能 0.980,token 少 14.9 倍;telecom 上技能追平推理(0.933),token 少 5.9 倍。
还有两个对照值得拎出来。第一,技能不一定要从推理轨迹蒸馏,只用非推理轨迹蒸馏出来的技能,和用配对语料蒸馏的几乎一样好。第二,和自动优化提示词的 GEPA 比,蒸馏技能在 retail 上 0.458 对 0.392,生产成本低 4.1 倍。
对做 agent 部署的人,这是个很实在的成本杠杆:一次性的几美元蒸馏,换每次调用省 2.7-6 倍 token,最好的情况下还更准。技能是纯文本,不碰模型权重,任何能改 system prompt 的模型都能用,落地门槛低。
它也点破了一个误区:推理模式的很多收益,其实是把本可以静态化的过程知识塞进了每次推理。能静态化的部分,没必要每次重算。
作者自己列了几条:技能是每个「模型×领域」蒸馏一次的,没测跨模型迁移;只跑了两个模型、四个领域;只量了评测方差(3 个随机种子),没量蒸馏本身的方差,换一次 Claude Code 的产出可能不一样。
更要紧的是,telecom 和 SpreadsheetBench 上技能明显够不到推理模式。这正是「每个任务都不同的知识」,蒸馏兜不住,得靠真正的逐步推理。Qwen 在 retail 上反而退步,说明这套流程不是每个组合都稳定。技能是自然语言,模型会不会照着做、会不会被别的指令干扰,论文没有系统检验。