MemHarness 论文:让智能体重构而非死记硬背过往经验

anselm · x · 2026-08-02

现有带记忆的 LLM 智能体通常直接将检索到的历史经验原封不动地塞入上下文,这往往因为与当前状态脱节而导致“负迁移”。

受人类回忆机制的启发,MemHarness 框架让智能体在决策前,先根据当前状态对历史记忆进行批判与重构,生成贴合当前情境的指导。该能力通过 GRPO 算法进行端到端训练获得。在 ALFWorld 和 WebShop 环境的测试中,该框架不仅全面超越了纯强化学习和静态记忆基线,还展现出极强的分布外(OOD)鲁棒性,从根本上提升了模型的内在推理能力。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →