Amazon 研究:SFT 同时监督观测 token,agent RL 探索显著提升

amazon · hf · 2026-09-18

Amazon 团队提出 ActObs:在 agent 轨迹的 SFT 阶段,不只对动作 token 计损失,也对轨迹中已有的环境观测 token 施加监督,从而让策略在不增加数据、参数、序列长度或前向计算的情况下学习预测动作后果。

主要发现:

机制分析:action-only 训练下动作与观测梯度迅速正交,残留的大观测梯度使环境预测能力低于基座模型;联合监督避免了这种单边特化,保留更高的 RL 熵和后果预测能力,为下游探索做好初始化。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →