自博弈训练能否突破上限?前 OpenAI 研究员称缺乏证据

Kangwook_Lee · x · 2026-09-26

前 Google 研究员 Rémi Leblond(syhw)讨论一款从零开始、纯自博弈(self-play)、不使用人类数据训练的游戏 AI,认为若把操作频率限制在峰值 500 APM/均值 300 APM,并增加 10 倍算力再训练,表现还会更强。

威斯康星大学教授 Kangwook Lee 回应表示怀疑:可能性不大,目前没有证据支持这种上限突破,并以 AlphaStar 为例。两位从业者在自博弈 + 人类约束 + 算力扩展能否持续提升上存在分歧。

所属事件:星际自博弈 AI 引发 AGI 基准之争(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →