微软论文:蒸馏技能卡可省数倍token

微软研究者在 arXiv 发表论文《Reason Wide, Not Deep》,提出将昂贵的测试时推理成本「只付一次」:从 35–50 条历史 agent 运行轨迹中提取反复出现的规则,写成技能卡供小模型复用。实验显示该方法可节省 2.7 至 6 倍输出 token,且效果能追平开启推理模式的模型。

2026-09-07 ~ 2026-09-07 · 2 条相关

另有 1 条近重复转述:rohanpaul_ai