Amazon MInTRL:稀疏离策略干预提升在线策略 RL 探索
amazon · hf · 2026-09-15
- Amazon 提出 MInTRL(Minimal Intervention RL),核心发现是离策略干预可以增强在线策略 RL。
- 方法:在 rollout 过程中施加稀疏的局部修正来改善在线探索,同时训练采用 sequence-level 的优势回归(advantage-regression)目标。
- 展示了以最小干预方式融合 off-policy 信息来提升 on-policy 训练效果的路线。
「研究」频道最新
- AI Beyond Scaling 播客上线,BOLD Fellows 首批申请今日英国时间中午截止 — j_foerst · 2026-09-15
- 微软提出 ESRL:锚定高置信专家提升 MoE 强化学习探索 — MicrosoftResearch · 2026-09-15
- Grouped Value Attention 分组存值按需重建 Key,压缩 KV Cache — Vishesh Tripathi · 2026-09-15
- 无状态故障转移丢失近 100% 上下文,ContinuityBench 提出 99.2% 保持率方案 — its_vayishu · 2026-09-15
- Phillip Isola 团队另辟蹊径:超快模拟器让 RL 从零起跑 — AjdDavison · 2026-09-15
- 只读前 50 条就漏掉 75% 少数证据:AI 验证器省成本实测 — iMiguelmars · 2026-09-15