论文把旧 agent rollout 蒸馏进权重,保留93.4%收益

burny_tech · x · 2026-07-28

Sample-Efficient Learning from Agent Experience

这篇论文提出一种面向 agent 的 Experience Distillation 方法:不再反复跑昂贵的环境交互,而是让一个“带经验的 teacher”查看旧的 agent rollout,在真实历史节点上给出下一步决策,再用这些决策去训练 student,把经验从上下文里蒸馏进模型权重。

摘要里的核心结果包括:

作者把它定义为一种把 agent 交互经验“写入权重”的更省样本方案。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →