Agent-G²:用高斯分布优化长期任务强化学习

ZhejiangUniversity · hf · 2026-08-27

Agent-G² 提出将提示深度建模为高斯分布,并从现有轨迹中在线估计。这种方法在无需额外探测的情况下,改善了长期任务上的强化学习性能。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →