Meta 新研究:用强化学习教 Agent 决策何时调用记忆

Meta 发布新论文指出,仅给长时程 Agent 增加记忆和工具并不够,关键在于训练 Agent 学会何时值得调用这些外部状态。研究提出 EvoHarness-RL 方法,基于 Qwen2.5 模型,通过强化学习解决长时程任务中 Agent 因任务过长而遗忘状态的问题,让 Agent 自主掌握外部记忆与工具的使用时机。

2026-08-24 ~ 2026-08-24 · 2 条相关