Meta 新研究:用强化学习教 Agent 决策何时调用记忆
Meta 发布新论文指出,仅给长时程 Agent 增加记忆和工具并不够,关键在于训练 Agent 学会何时值得调用这些外部状态。研究提出 EvoHarness-RL 方法,基于 Qwen2.5 模型,通过强化学习解决长时程任务中 Agent 因任务过长而遗忘状态的问题,让 Agent 自主掌握外部记忆与工具的使用时机。
2026-08-24 ~ 2026-08-24 · 2 条相关
- Meta 新研究:用 RL 训练 Agent 决策何时使用记忆 — rohanpaul_ai · 2026-08-24
- Meta 论文:仅增工具记忆不足,Agent 需学会何时调用 — daniel_mac8 · 2026-08-24