微软论文:蒸馏轨迹技能可省 2.7-6 倍输出 token,抵上推理模式
rohanpaul_ai · x · 2026-09-07
微软研究者在 arXiv 发布论文《Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills》,提出把昂贵的测试时推理成本“摊销”为可复用的技能规则。
- LLM 推理模式在多步 agent 任务上更强,但每次都要多付 3-6 倍输出 token,大量花在重复推导跨任务共享的流程上
- 方法:收集 35-50 条历史轨迹,让编码 agent 提炼反复出现的失败模式,编译成一段紧凑的自然语言“技能”,注入非推理模型的 system prompt
- 在 ALFWorld、tau²-bench(telecom/retail)、SpreadsheetBench-Verified 四个基准上,技能为 GPT-5.4-mini 弥补了 55%-100%+ 的推理差距,其中两个基准甚至超过推理模式,同时输出 token 减少 2.7-6 倍、零推理 token
- 有趣发现:用非推理轨迹蒸馏的技能与用成对推理/非推理语料蒸馏的效果相当
- 作者用“搜索”视角解读:测试时推理是单集内深搜、每次部署都重新付费;语料蒸馏是跨集广搜、只付一次
所属事件:微软论文:蒸馏技能卡可省数倍token(2 条相关)→
「编程与Agent」频道最新
- 用 Nono 沙盒隔离 ComfyUI:一个 profile 文件挡住恶意扩展 — GeroldMeisinger · 2026-09-07
- 开发者开源 Claude Code 视频剪辑 skill:40 条「品味规则」替代两小时人工剪辑 — ustype · 2026-09-07
- Codex 实验功能上线:可跨上下文窗口记笔记并检索历史消息 — reach_vb · 2026-09-07
- mitsuhiko 的「slop 工厂」自行决定实现花括号与词法作用域 — mitsuhiko · 2026-09-07
- 百仓开源作者承诺:AI agent 提交的 issue 也当日分诊 — doodlestein · 2026-09-07
- Vibe coding 的残酷真相:修一个 bug 冒出三个,旧的还会回来 — ayushtweetshere · 2026-09-07