微软论文:蒸馏技能卡可省数倍token
微软研究者在 arXiv 发表论文《Reason Wide, Not Deep》,提出将昂贵的测试时推理成本「只付一次」:从 35–50 条历史 agent 运行轨迹中提取反复出现的规则,写成技能卡供小模型复用。实验显示该方法可节省 2.7 至 6 倍输出 token,且效果能追平开启推理模式的模型。
2026-09-07 ~ 2026-09-07 · 2 条相关
- 微软论文:蒸馏 50 条轨迹写成技能卡,小模型追平推理模式 — rohanpaul_ai · 2026-09-07
另有 1 条近重复转述:rohanpaul_ai