ActObs 论文:SFT 同时监督环境观测,显著提升 Agent RL 效果

kastnerkyle · x · 2026-09-19

论文《Don't Mask the Environment》提出 ActObs 方法:标准 SFT 只对 agent 生成的动作 token 计算损失,ActObs 则同时对轨迹中已有的环境观测 token 做监督,让策略学会预测动作后果——不增加任何数据、参数、序列长度或前向计算。

关键结果:

机制分析:ActObs 在 RL 过程中保留更多熵、所需策略移动更小,最终策略更贴近 SFT 初始化;作者将差异追溯到 SFT 阶段动作与观测梯度的快速正交化。

所属事件:ActObs 方法:SFT 同时监督环境观测,大幅提升 Agent RL 效果(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →