Wayfarer 自主发现 options,攻克 Montezuma's Revenge 等硬核 Atari 游戏
MarlosCMachado · x · 2026-10-05
作者 Marlos C. Machado 强烈推荐的 arXiv 论文《Mastering Atari 2600 Games with Discovered Options》(与 Erik M. Lintunen 合著)。
- 提出 Wayfarer:一个通用、领域无关的在线深度 RL 智能体,通过 Laplacian 表征学习从高维观测中自动发现 options(时间抽象技能),再用于控制。
- 此前 option discovery 方法要么局限于简单领域、依赖手工/准符号表征,要么相比不使用 options 几乎无提升。
- 发现的 options 同时改善探索、加速 credit assignment,并能泛化到未见环境。
- 在最具挑战性的 Atari 2600 游戏上达到单流智能体 SOTA,长程探索类游戏(如 Montezuma's Revenge、Private Eye)提升最大。
- 有趣发现:在 Freeway 中,智能体自动学到只关注自身可控的自由度(向上移动),而非汽车。作者称这兑现了他十年前《Learning Purposeful Behaviour in the Absence of Rewards》中 options 的愿景。
所属事件:DeepMind 提出 Wayfarer:自主发现 options 攻克高难 Atari(9 条相关)→
「研究」频道最新
- COLM 2025 附会:共谋行为审计研究将登 AdvML-Frontiers 工坊 — nandofioretto · 2026-10-05
- 350M 小模型微调做 PII 脱敏,识别率 89.7% 提到 99.7% — JosephJacks_ · 2026-10-05
- Wondersearch 称在 SciFact 上击败所有密集 embedding 模型 — NirantK · 2026-10-05
- Muse Spark 与数学家合作解决 6 个公开数学难题 — YiMaTweets · 2026-10-05
- Triton GPU 编程系统课:从 H100 架构讲到 FlashAttention — kalyan_kpl · 2026-10-05
- MICCAI 2026 收录 1167 篇论文,埃尔朗根团队独中 11 篇 — maier_ak · 2026-10-05