DeepMind 提出 Wayfarer:自主发现 options 攻克高难 Atari
DeepMind 研究员 Marlos Machado 于 10 月 5 日在推文中介绍了与同事 Erik M. Lintunen 合著的新论文《Mastering Atari 2600 Games with Discovered Options》,提出通用 option-discovery 方法 Wayfarer,在高难度 Atari 2600 游戏上全面超越 DreamerV3、IQN、Rainbow 等基线,值得强化学习领域关注。
已确认
- Wayfarer 学习以 agent 为中心的 Laplacian 表征,用其定义内在奖励来塑造 options;options 又反过来塑造 agent 的经验,进而更新表征与 options,形成良性循环。
- 结果在一组高难度 Atari 游戏上验证——这些游戏因探索和信用分配困难,历史进展远慢于平均水平;团队还做了组件消融分析,表征各部分贡献。
- Machado 指出其发现的 options 同时改善探索、信用分配和迁移三个方面。
- 在 Montezuma's Revenge 中,agent 无需领域知识即可发现可排序的 options,到达第三屏所需决策数减少两个数量级;发现的「走过瓷砖地板并下楼梯」等 option 可泛化到从未见过的房间。
- 支持时间上扩展的探索:例如在 Private Eye 中执行一个 option 就能让 agent 扫描整个环境。
- 学到的表征只关注 agent 可控因素——在 Freeway 中 agent 不学汽车,自然学出游戏唯一自由度,只学「往上走」。这种以 agent 为中心的表征被认为是方法有效性的关键。
为什么重要
- 探索与信用分配是稀疏奖励环境长期难题,Wayfarer 用一个统一机制同时改善探索、信用分配与迁移,且无需领域知识,具有较强通用性。
2026-10-05 ~ 2026-10-05 · 9 条相关
一手来源
- Wayfarer 自主发现 Options,攻克 Atari 难题超越 DreamerV3 — MarlosCMachado ·
- 一个方法同时改善探索、信用分配与迁移,Wayfarer 全面超越基线 — MarlosCMachado ·
- 【源头】Wayfarer 自主发现 Options,攻克 Atari 难题超越 DreamerV3 — MarlosCMachado · 2026-10-05
- Wayfarer 用 Laplacian 表征+内在奖励,让 options 自我进化 — MarlosCMachado · 2026-10-05
- 【源头】一个方法同时改善探索、信用分配与迁移,Wayfarer 全面超越基线 — MarlosCMachado · 2026-10-05
- 单个 option 扫全图:Wayfarer 支持长时间跨度的探索 — MarlosCMachado · 2026-10-05
- 无领域知识发现 options,Wayfarer 决策步数减少两个数量级 — MarlosCMachado · 2026-10-05
- Wayfarer 发现的 options 能泛化到从未见过的游戏房间 — MarlosCMachado · 2026-10-05
- Wayfarer 在探索最难的 Atari 游戏集上验证,并做了组件消融 — MarlosCMachado · 2026-10-05
- Wayfarer 学出「只关注可控因素」的表征:Freeway 里只学向上 — MarlosCMachado · 2026-10-05
另有 1 条近重复转述:MarlosCMachado