一文梳理强化学习自博弈的演化史:从 TD-Gammon 到 AlphaGo
cephaloform · x · 2026-09-27
这是一篇发表于 2019 年的强化学习自博弈(self-play)历史科普长文。
- 问题背景:经典单智能体 RL 用 MDP 建模静态环境,以最大化回报为解;但多智能体系统中,某策略的最优性依赖其他智能体的行为,如何定义实用的解并不清楚。直接对所有可能策略求期望回报往往计算上不可行,随机策略下策略集甚至无穷大。
- 早期近似方法:MARL 的一种思路是预先准备一组固定基准智能体,训练并以此衡量策略表现。这依赖两个假设:基准策略可获得;且它们在博弈论意义上支配大部分策略空间。基准策略可来自人类专家数据监督学习(如 TD-Gammon、AlphaGo),也可基于树搜索等方法构造。
- 文章随后按历史脉络展开 AlphaGo Zero 等自博弈方法的演化(节选未完整展示)。
适合作为理解多智能体 RL 与自博弈解概念的历史入门材料。
「研究」频道最新
- 观点:预训练本质上是全信息反馈的单 token rollout RL — burny_tech · 2026-09-27
- 语言带宽仅约 56k 调制解调器,模型训练的只是世界的有损残影 — yunta_tsai · 2026-09-27
- 先天—经验之争或源于「学习」一词的多义性 — abenitezburraco · 2026-09-27
- 实验:LLM 的 JSON 合法≠决策一致,一致性最低仅 14.4% — tenkei_01 · 2026-09-27
- BrushArena 直播 RL 训练全程,绘画模型实时进化可围观 — xeophon · 2026-09-27
- Rethink Priorities 发布数字意识模型:2024 LLM 无意识证据不决定性 — burny_tech · 2026-09-27