ActObs 论文:SFT 同时监督环境观测,显著提升 Agent RL 效果
kastnerkyle · x · 2026-09-19
论文《Don't Mask the Environment》提出 ActObs 方法:标准 SFT 只对 agent 生成的动作 token 计算损失,ActObs 则同时对轨迹中已有的环境观测 token 做监督,让策略学会预测动作后果——不增加任何数据、参数、序列长度或前向计算。
关键结果:
- SFT 后两种方法表现相近,但经 GRPO 强化学习后差距拉开
- Qwen3-4B 上,ActObs 初始化的 GRPO 在 Terminal-Bench 2.0 各采样预算下 pass@k 全面更高
- Qwen3-8B 上以少量 pass@1 可靠性换取更高 pass@k(pass@16 +3.4pp),解出更多不同任务
- 跨域代码编辑 aider-polyglot 上 pass@1 +4.2pp(4B,任务在 SFT/RL 中均未见过)
机制分析:ActObs 在 RL 过程中保留更多熵、所需策略移动更小,最终策略更贴近 SFT 初始化;作者将差异追溯到 SFT 阶段动作与观测梯度的快速正交化。
所属事件:ActObs 方法:SFT 同时监督环境观测,大幅提升 Agent RL 效果(2 条相关)→
「编程与Agent」频道最新
- Yacine:即使用最强模型,仍需逐行审查代码,决策大多不佳 — yacineMTB · 2026-09-19
- TypeSafe AI 决策模型 Jev 上架 Merge Gateway,输出完全免费 — shensi · 2026-09-19
- Jev Directory 收录 50 个可运行评测与 722 个社区构建案例 — thisiskp_ · 2026-09-19
- 工程师实践:规划用旗舰模型,执行用 GLM、DeepSeek 等平价模型 — TheZachMueller · 2026-09-19
- Agent 时代编程四大转变:所有权、原语、自治与工作流 — johnlindquist · 2026-09-19
- Typesafe 发布分类模型 Jev,宣称比 LLM 快省至 200-400 倍 — hwchase17 · 2026-09-19