微软新论文:用蒸馏技能替代推理,节省2.9-4.5倍token

rohanpaul_ai · x · 2026-08-15

微软新论文提出一种降低测试时推理成本的方法:从过去的agent轨迹中提取重复失败模式,转化为小型markdown技能,加入非推理模型的系统提示中。实验显示,在4个agent基准上,该方法恢复了非推理与推理模式差距的55%-100%+,同时输出token减少2.9-4.5倍。在ALFWorld和τ²-retail上,带技能的非推理模型甚至超过了推理模式。蒸馏器不需要推理轨迹,仅用非推理rollout构建的技能在所有4个领域都有竞争力。但推理在电信和SpreadsheetBench上仍占优,因为任务包含更多实例特定依赖。实际应用:一次性蒸馏重复流程,将昂贵的推理留给真正需要新搜索的任务。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →