微软 ActiveSaddler:自动课程学习让 Agent harness 提升 7.5 个百分点

microsoft · hf · 2026-10-02

微软提出 ActiveSaddler,把「训练场景选择」作为 agent harness 自动优化中缺失的一维。现有方法只优化 harness 的 prompt、工具接口和控制逻辑,却固定了产生反馈的训练场景;而随着 harness 演化,最有用的场景也在变化。ActiveSaddler 将课程建模为非平稳 bandit:把反复出现的失败抽象为可复用的「失败模式臂」,估计继续攻克每种模式的潜在学习收益,并在重访已知弱点与探索新场景间自适应平衡。在 GAIA2 和 Terminal-Bench 2.0 上,相比固定场景顺序,Pass@1 分别提升 4.4 和 7.5 个百分点。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →