Meta 新研究:用 RL 训练 Agent 决策何时使用记忆
rohanpaul_ai · x · 2026-08-24
Meta 提出名为 EvoHarness-RL 的新方法,旨在解决长时程 Agent 因任务过长而遗忘状态的问题。
核心发现: 单纯给 Agent 增加记忆和工具是不够的,关键在于训练它何时值得使用外部状态。EvoHarness-RL 通过强化学习让策略模型学会在“调用外部状态(信念、进度、经验)”与“节省交互步数”之间做权衡。
实验效果:
- 在 ALFWorld 任务上,Qwen3-8B 配合 ReAct 仅得 47.9%;使用 EvoHarness-RL 后提升至 96.9%(已见任务)和 86.6%(未见任务)。
- 在训练过程中,随着成功率的提升,外部状态的调用频率逐渐下降至每轮约 1 次,表明常规行为已内化到模型权重中,仅在关键时刻才查阅外部记忆。
结论: Agent 构建者不应硬编码频繁访问,而应训练策略来决定何时查询和更新记忆。
所属事件:Meta 新研究:用强化学习教 Agent 决策何时调用记忆(2 条相关)→
「编程与Agent」频道最新
- 企业 Agent 需架构约束,非仅数据质量 — jonerp · 2026-08-24
- 谷歌发布 Developer Knowledge MCP,集成 19 套文档 — rseroter · 2026-08-24
- 用 Cloudflare Workers 写了个 Agent 专治网页设计垃圾 — craigsdennis · 2026-08-24
- Obsidian 插件 Smart Chat:AI 对话链接与状态直接存进笔记 — AINewsletter · 2026-08-24
- 用 AI 写代码虽快,但理解项目历史却成了新负担 — Warm-Reaction-456 · 2026-08-24
- 给每个 Agent 分配真实邮箱后,我们踩了这些坑 — saltexx · 2026-08-24