2026-08-11
AlphaGo 靠策略网络选点、价值网络评棋,叠加强化学习与蒙特卡洛搜索,5:0 击败职业棋手樊麾,首次让电脑拿下围棋。
围棋被公认为经典棋类里最难啃的硬骨头。难点不是规则复杂,而是两条:搜索空间大到穷举不可能,棋局状态数远超国际象棋;以及一个局面「到底好不好」极难评估,一步棋的价值常常要到几十手之后才显现。1997 年「深蓝」拿下国际象棋后,围棋长期被业内认为「至少还要十年」才能被电脑攻克,那时最强的程序仍停留在人类业余水平。当时最强的方法是蒙特卡洛树搜索(MCTS),用大量随机模拟去估局面,但靠的是暴力模拟,没有真正的「棋感」。
AlphaGo 的核心是把人类的棋感蒸馏成神经网络,再让网络自己超越自己。它训练了两种网络:
两个网络都通过监督学习与强化学习训练得到:先用人类高手的对局棋谱做监督学习,教网络模仿专业棋手的选点;再用强化学习让程序自我对弈,不断打败前一版的自己,把水平推到人类棋谱之外。对弈时,AlphaGo 把这两个网络接进蒙特卡洛树搜索,用策略网络缩小该搜的分支,用价值网络和蒙特卡洛模拟给局面打分,在有限次模拟里做出远比纯 MCTS 精确的判断。
这套设计最关键的取舍在「预测的对象」:它预测的是结构化的潜变量,选点分布和价值评估,与今天大语言模型预测下一个 token 的范式不同。
摘要给出的几个数字:
| 对手 | 设置 | 结果 |
| 其他围棋程序 | 锦标赛 | 99.8% 胜率 |
| 樊麾(欧洲冠军) | 五番棋 | 5:0 |
| 仅用神经网络、不做搜索 | 对照 | 与模拟数千盘随机棋的 SOTA MCTS 程序相当 |
需要说明:更细的分项 Elo 等级分、各网络单独的命中率等数据在 Nature 原文的付费墙内。本篇依据公开摘要与图表标题写成,未取到正文细节。
这是电脑程序第一次在 19 路围棋上击败人类职业棋手,把「至少还要十年」的预期直接兑现。对从业者的启示是这套配方:先蒸馏人类直觉,再用自我对弈超越它,最后把学到的判断接进搜索。这条思路后来被 AlphaZero 去掉对人类棋谱的依赖、被 MuZero 推广到不掌握规则的环境,成为「先学评估、再搜索」这一派的模板。
放到当下的讨论里看,AlphaGo 在 token 预测成为主流范式之前,就靠预测价值与策略这种结构化潜变量达到了超人类水平。它是一个实在的反例:预测下一个 token 并非通往强 AI 的唯一抽象层级。