Amazon 研究:SFT 同时监督观测 token,agent RL 探索显著提升
amazon · hf · 2026-09-18
Amazon 团队提出 ActObs:在 agent 轨迹的 SFT 阶段,不只对动作 token 计损失,也对轨迹中已有的环境观测 token 施加监督,从而让策略在不增加数据、参数、序列长度或前向计算的情况下学习预测动作后果。
主要发现:
- SFT 后两种方法表现接近,但在 GRPO 强化学习阶段显著分化
- Qwen3-4B 上,ActObs 起点的 GRPO 在 Terminal-Bench 2.0 所有采样预算下 pass@k 均更高
- Qwen3-8B 上以少量 pass@1 可靠性换取更高 pass@k(pass@16 +3.4pp),解出更多不同任务
- 跨域迁移到未训练过的 aider-polyglot 代码编辑任务,pass@1 提升 4.2pp(4B)
机制分析:action-only 训练下动作与观测梯度迅速正交,残留的大观测梯度使环境预测能力低于基座模型;联合监督避免了这种单边特化,保留更高的 RL 熵和后果预测能力,为下游探索做好初始化。
「研究」频道最新
- 新论文:抑制 LLM 自我归因会使其价值观偏离人类规范 — coherence · 2026-09-18
- AI4Science 论文周更泛滥,这份周刊帮你筛出可迁移的少数 — bravo_abad · 2026-09-18
- 跨尺度涌现新方法用于 EEG 意识状态研究,论文正式发表 — anilkseth · 2026-09-18
- AndroidLife 真机基准首跑:Qwen3.8-27B 控制 Android 手机成功率仅 56.7% — East-Muffin-6472 · 2026-09-18
- WeirdML v3 发布:11 个手工任务测模型的 agentic 数据分析能力 — scaling01 · 2026-09-18
- 斯坦福团队推出 AI 共同作者平台 CoPaper,已有多篇论文经它发表 — JeremyNguyenPhD · 2026-09-18