微软 ActiveSaddler:自动课程学习让 Agent harness 提升 7.5 个百分点
microsoft · hf · 2026-10-02
微软提出 ActiveSaddler,把「训练场景选择」作为 agent harness 自动优化中缺失的一维。现有方法只优化 harness 的 prompt、工具接口和控制逻辑,却固定了产生反馈的训练场景;而随着 harness 演化,最有用的场景也在变化。ActiveSaddler 将课程建模为非平稳 bandit:把反复出现的失败抽象为可复用的「失败模式臂」,估计继续攻克每种模式的潜在学习收益,并在重访已知弱点与探索新场景间自适应平衡。在 GAIA2 和 Terminal-Bench 2.0 上,相比固定场景顺序,Pass@1 分别提升 4.4 和 7.5 个百分点。
「编程与Agent」频道最新
- 700 个工具的 awesome-jev 清单:专管生产环境的「决策模型」生态 — Remarkable-Gur719 · 2026-10-02
- 花 1 万美元推理费,AI 几天完成人类专家需数年的 TS 转 C++ 移植 — kristoph · 2026-10-02
- Basis Theory 推出可撤销凭证,让 Agent 能行动但不碰你的密钥 — km · 2026-10-02
- smolvm v1.22 发布:agent 动作可撤销,快照恢复近瞬时 — LoganGrasby · 2026-10-02
- Spawn 作者长文:AI 时代还有几年正常期,什么才值得造 — TAbrodi · 2026-10-02
- 开发者在终端用 Claude Code 播视频:每帧 19.5 万字符像素 — edwinarbus · 2026-10-02