Meta 新研究 EvoHarness-RL:让智能体自主学习外部框架策略

omarsar0 · x · 2026-08-10

Meta 发布了一项关于智能体(Agent)的新研究 EvoHarness-RL。目前智能体的外部框架大多依赖手工编写,难以在长周期任务中保持稳健。

该研究提出让智能体离线学习框架策略,并在运行时动态构建和更新外部状态。具体而言,模型通过监督微调学习动作空间,随后利用成本感知的 GRPO 算法探索在长流程任务中何时读取、更新和整合信息。实验显示,Qwen3-8B 在 ALFWorld 基准上达到了 96.9% 的成功率。

训练过程中展现出两种动态特性:

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →