ActObs 方法:SFT 同时监督环境观测,大幅提升 Agent RL 效果
Amazon 团队在论文《Don't Mask the Environment》中提出 ActObs 方法。标准 SFT 只对 agent 生成的动作 token 计算损失,而 ActObs 在 agent 轨迹的 SFT 阶段同时对轨迹中已有的环境观测 token 施加监督,且不增加推理成本。实验显示该方法能显著提升后续强化学习的探索与整体效果。
2026-09-18 ~ 2026-09-19 · 2 条相关
- Amazon 研究:SFT 同时监督观测 token,agent RL 探索显著提升 — amazon · 2026-09-18
- ActObs 论文:SFT 同时监督环境观测,显著提升 Agent RL 效果 — kastnerkyle · 2026-09-19