论文把旧 agent rollout 蒸馏进权重,保留93.4%收益
burny_tech · x · 2026-07-28
Sample-Efficient Learning from Agent Experience
这篇论文提出一种面向 agent 的 Experience Distillation 方法:不再反复跑昂贵的环境交互,而是让一个“带经验的 teacher”查看旧的 agent rollout,在真实历史节点上给出下一步决策,再用这些决策去训练 student,把经验从上下文里蒸馏进模型权重。
摘要里的核心结果包括:
- 不需要额外环境 rollouts,也不需要很长的合成轨迹。
- 仍能保留最高 93.4% 的 in-context learning 收益。
- 相比经典 RL baseline,达到同等表现时可使用至少 9.6 倍更少 的环境样本。
- 在 749 个软件工程任务 和 6 个文字冒险游戏 上,至少保留了 64.8% 的 ICL 增益。
作者把它定义为一种把 agent 交互经验“写入权重”的更省样本方案。
「编程与Agent」频道最新
- AI Agent 正在重塑安全工作流,Black Hat 也在盯着看 — drhyrum · 2026-07-28
- GitHub 项目把专家方法论变成可复用 AI skills — tom_doerr · 2026-07-28
- 一家创业公司在做开源 AI harness,先问社区要什么功能 — athsrva · 2026-07-28
- ChatGPT Voice 和 Codex 在锁屏 Mac 上完成亚马逊任务 — SIGKITTEN · 2026-07-28
- 用前沿模型搭技能,再循环调用 GLM 5.2 直到成功 — steipete · 2026-07-28
- Mnemos 将重做桌面应用并上线新 MCP 工具平台 — RileyRalmuto · 2026-07-28