自博弈从零训练的游戏 AI 强到离谱,前 DeepMind 研究员称再加 10 倍算力会更强

syhw · x · 2026-09-26

前 DeepMind 研究员 syhw 评论某款用自博弈(self-play)从零训练、完全不依赖人类数据的游戏 AI,称这就是「正道」。他判断:如果把峰值 APM 限制在 500、平均 300(接近人类水平),再加 10 倍算力训练,模型会比现在更强。观点指向纯自监督强化学习路线在复杂游戏上的天花板仍未到。

所属事件:星际自博弈 AI 引发 AGI 基准之争(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →