微软提出 ActiveSaddler:动态调整训练场景,agent 优化器 Pass@1 提升最高 7.5 分
dair_ai · x · 2026-10-04
微软等机构发表新论文,提出优化 agent harness 的新方法 ActiveSaddler。
- 问题:现有 harness 优化器只改变 harness 的更新方式,训练场景固定不变,导致随着 harness 提升,反馈逐渐失去信息量。
- 方法:ActiveSaddler 将反复出现的失败归类为失败模式(failure pattern),把每个模式当作非平稳多臂老虎机(non-stationary bandit)的一个臂;追踪 harness 仍能从每个模式学到多少,并在「重访已知弱点」与「探索新弱点」之间分配预算,同时动态调整场景。
- 效果:使用同一优化器,与固定场景顺序相比,GAIA2 上测试 Pass@1 提升 4.4 分,Terminal-Bench 2.0 上提升 7.5 分。
「编程与Agent」频道最新
- 智能体设计第 5 课:明确这 5 种情况就该转人工,别让 agent 硬扛 — goyalshaliniuk · 2026-10-04
- AI agent 卡死怎么办:5 个让智能体脱离死循环的实用方法 — goyalshaliniuk · 2026-10-04
- 开源 SDK 把 ESP32 变成语音终端,随时对话你自己的 Hermes Agent — Teknium · 2026-10-04
- Opus 5.5 全程写代码造出戛纳级短片《I Have Never Seen the Sun》 — Alternative-Duty-532 · 2026-10-04
- Slack 机器人查单翻车复盘:如何阻止 LLM 在工具没跑时编答案 — Aggressive-Narwhal-3 · 2026-10-04
- 开发者用 Claude 写出 Minecraft 原生 Metal 渲染器,老 Mac 也能 60fps 开光影 — EddyVGG · 2026-10-04