ActObs 方法:SFT 同时监督环境观测,大幅提升 Agent RL 效果

Amazon 团队在论文《Don't Mask the Environment》中提出 ActObs 方法。标准 SFT 只对 agent 生成的动作 token 计算损失,而 ActObs 在 agent 轨迹的 SFT 阶段同时对轨迹中已有的环境观测 token 施加监督,且不增加推理成本。实验显示该方法能显著提升后续强化学习的探索与整体效果。

2026-09-18 ~ 2026-09-19 · 2 条相关