SEED:自进化代理强化学习

heghbalz · x · 2026-07-19

这条转发介绍了一篇名为 **SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning** 的论文。 核心思路是:把每次完成的 agent trajectory 变成一个“hindsight skill”,再用同一套持续演化的 policy 重新给采样动作打分,于是同一模型同时承担两件事: - 用稀疏的最终结果做 RL 训练 - 用密集的 token 级信号做蒸馏 配图展示了它在 **ALFWorld、Search-based QA、WebShop** 三个基准上的结果,相比 vanilla、GRPO、skill-distillation 等方法,SEED 在多个指标上更高,尤其在 ALFWorld 平均分达到 **91.8**,Search-based QA 平均 **45.7**,WebShop 成功率 **78.9**。

所属事件:SEED:面向智能体强化学习的自进化蒸馏框架(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →