Agent 轨迹的 GAE 处理

ziv_ravid · x · 2026-07-11

作者在讨论 agent 轨迹 的优势传播方式:模型动作与环境观察会交错出现,如果直接用标准 GAE,优势会穿过很多模型并没有“生成”的 observation tokens。为此,他们把一个动作的最后 token 直接连到下一个动作的第一个 token,避免把学习信号传到不该传的地方。

这是一条典型的 agent 训练方法讨论,重点在于怎样更合理地处理交互轨迹。

所属事件:GLM团队提出SAO算法,突破智能体异步强化学习瓶颈(15 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →