MemHarness:记忆重构而非直接回放,让智能体更可靠

rohanpaul_ai · x · 2026-08-05

传统记忆增强智能体常将语义相似的过往经验直接塞入上下文,但这可能因状态变化而失效甚至变成噪音。

MemHarness 提出了一种记忆重构机制,在检索和行动之间加入决策步骤:智能体会对比记忆的原始状态与当前状态,重写可迁移的部分,或在不适配时直接拒绝并依靠无记忆推理。该重构过程通过 GRPO(Group Relative Policy Optimization)基于任务奖励进行端到端学习。

实验表明,在 ALFWorld 和 WebShop 基准上,该方法显著优于无记忆的强化学习基线。有趣的是,即使在测试时禁用记忆,经过该方法训练的策略依然保持较高成功率,说明记忆重构不仅提升了推理时的适应性,还促使策略本身学会了更细致的局势判断。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →