SEED:自进化代理强化学习
heghbalz · x · 2026-07-19
这条转发介绍了一篇名为 **SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning** 的论文。 核心思路是:把每次完成的 agent trajectory 变成一个“hindsight skill”,再用同一套持续演化的 policy 重新给采样动作打分,于是同一模型同时承担两件事: - 用稀疏的最终结果做 RL 训练 - 用密集的 token 级信号做蒸馏 配图展示了它在 **ALFWorld、Search-based QA、WebShop** 三个基准上的结果,相比 vanilla、GRPO、skill-distillation 等方法,SEED 在多个指标上更高,尤其在 ALFWorld 平均分达到 **91.8**,Search-based QA 平均 **45.7**,WebShop 成功率 **78.9**。
所属事件:SEED:面向智能体强化学习的自进化蒸馏框架(2 条相关)→
「编程与Agent」频道最新
- Every 正在招聘一名 agent 团队高级工程师 — danshipper · 2026-07-21
- Freerange 可静态证明 UI 代码数值范围,无需运行应用 — cnakazawa · 2026-07-21
- pen.dev 让多家前沿模型并行评测前端设计 — yakuzeg · 2026-07-21
- ComfyUI 变慢或因模型反复读盘,而非硬件故障 — J6j6 · 2026-07-21
- ZooData 一次 API 调用把网页转成 agent 可用 JSON — dr_cintas · 2026-07-21
- 同题对测两款模型都一次过,讨论转向 Loop Engineering — glenbeer · 2026-07-21