Meta 新研究 EvoHarness-RL:让智能体自主学习外部框架策略
omarsar0 · x · 2026-08-10
Meta 发布了一项关于智能体(Agent)的新研究 EvoHarness-RL。目前智能体的外部框架大多依赖手工编写,难以在长周期任务中保持稳健。
该研究提出让智能体离线学习框架策略,并在运行时动态构建和更新外部状态。具体而言,模型通过监督微调学习动作空间,随后利用成本感知的 GRPO 算法探索在长流程任务中何时读取、更新和整合信息。实验显示,Qwen3-8B 在 ALFWorld 基准上达到了 96.9% 的成功率。
训练过程中展现出两种动态特性:
- 框架退火:频繁调用的框架模式逐渐被吸收进模型自身的策略中,智能体从频繁调用转向选择性访问。
- 框架演化:进度更新和经验整合被有效压缩。
「编程与Agent」频道最新
- Agent工作流优化:模型应在工具运行时保持思考 — cephaloform · 2026-08-10
- Scale AI 创始人:多智能体已能自主寻找 0-day 漏洞 — alexandr_wang · 2026-08-10
- 避免自动回复 Agent 陷入死循环的工程实践 — kumard3 · 2026-08-10
- 用 TRL 与 OpenCode 在远程沙箱中训练 AI 编程智能体 — NielsRogge · 2026-08-10
- 盘点 13 个值得关注的 AI Agent 开源框架与 SDK — TheTuringPost · 2026-08-10
- Meta 编程智能体亏本定价:以极低价格换取训练数据 — shashib · 2026-08-10