微软论文:蒸馏 50 条轨迹写成技能卡,小模型追平推理模式
rohanpaul_ai · x · 2026-09-07
微软新论文探索「推理成本只付一次」:用少量从历史 agent 运行中学到的规则,替代昂贵的测试时推理。
方法
- 收集 35–50 条过往轨迹,让编码 agent 提取反复出现的失败模式
- 把模式写成一份小型 markdown 技能,注入非推理模型的 system prompt
结果
- GPT-5.4-mini 上,这些技能在 4 个 agent 基准中恢复了非推理与推理模式差距的 55%–100%+,输出 token 少 2.9–4.5 倍
- 在 ALFWorld 和 τ²-retail 上,带技能的非推理模型反超推理模式
- 蒸馏器不需要推理轨迹:仅用廉价非推理 rollout 构建的技能在全部 4 个领域都有竞争力
边界
- 推理模式仍在 telecom 和 SpreadsheetBench 上胜出——这些任务包含大量实例特定依赖,固定技能无法覆盖
实践结论:把重复流程蒸馏成技能,把昂贵的测试时推理留给真正需要即时搜索的任务。
所属事件:微软论文:蒸馏技能卡可省数倍token(2 条相关)→
「编程与Agent」频道最新
- 用 Nono 沙盒隔离 ComfyUI:一个 profile 文件挡住恶意扩展 — GeroldMeisinger · 2026-09-07
- 开发者开源 Claude Code 视频剪辑 skill:40 条「品味规则」替代两小时人工剪辑 — ustype · 2026-09-07
- Codex 实验功能上线:可跨上下文窗口记笔记并检索历史消息 — reach_vb · 2026-09-07
- mitsuhiko 的「slop 工厂」自行决定实现花括号与词法作用域 — mitsuhiko · 2026-09-07
- 百仓开源作者承诺:AI agent 提交的 issue 也当日分诊 — doodlestein · 2026-09-07
- Vibe coding 的残酷真相:修一个 bug 冒出三个,旧的还会回来 — ayushtweetshere · 2026-09-07