为什么自博弈在围棋中有效,在 LLM 中却很难?

i_dg23 · x · 2026-08-01

作者探讨了自博弈在双人零和博弈(如围棋、扑克、星际争霸)中表现优异,但在现实领域应用困难的原因。

核心在于,自博弈在双人零和博弈中会收敛至极小化极大策略,这是一种期望上不可战胜的策略。然而,这并不总是最优选择:如果对手很弱,采用该策略可能无法实现收益最大化(例如在扑克中无法从弱玩家身上赢最多的钱)。由于现实世界环境极其复杂且非零和,自博弈在 LLM 训练中尚未取得广泛成功。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →