前 DeepMind 研究员:星际争霸自博弈 RL 难题已被 3 亿参数模型攻克

syhw · x · 2026-09-25

Google DeepMind 研究员 syhw(曾参与 AlphaStar 时期工作)表示,他 2016 年立下的「用自博弈 RL 从零攻克星际争霸:母巢之战」目标如今已完成——而且是由一个仅 3 亿参数的模型实现,并附上相关链接。这一对比 AlphaStar 时代动辄数亿美元训练成本的成果,引发对高效 RL 训练的关注。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →