RoMeRL:解决自进化智能体记忆的奖励陷阱

Yi Yang · hf · 2026-08-11

研究提出 RoMeRL (Reduced-Order Memory Reinforcement Learning),旨在解决自进化 LLM 智能体在学习记忆时面临的反馈分散和记忆-奖励陷阱问题。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →