自博弈训练能否突破上限?前 OpenAI 研究员称缺乏证据
Kangwook_Lee · x · 2026-09-26
前 Google 研究员 Rémi Leblond(syhw)讨论一款从零开始、纯自博弈(self-play)、不使用人类数据训练的游戏 AI,认为若把操作频率限制在峰值 500 APM/均值 300 APM,并增加 10 倍算力再训练,表现还会更强。
威斯康星大学教授 Kangwook Lee 回应表示怀疑:可能性不大,目前没有证据支持这种上限突破,并以 AlphaStar 为例。两位从业者在自博弈 + 人类约束 + 算力扩展能否持续提升上存在分歧。
所属事件:星际自博弈 AI 引发 AGI 基准之争(4 条相关)→
「研究」频道最新
- 新立场论文:LLM 擅长归纳演绎,缺的是溯因推理 — bibryam · 2026-09-26
- 332MB 文档分类小模型 BeeNara:敢说「都不匹配」 — razer_psycho · 2026-09-26
- InternLM 开源 Intern-Decision 4B/0.8B:一次前向完成结构化决策 — jacek2023 · 2026-09-26
- 斯坦福用哲学概念做预训练:自生成普适事实,Noah Goodman 戏称实现 ASI — xuanalogue · 2026-09-26
- 新方法可在多款模型上找出「伪探针」:评测时推荐绿茶,生产中却推乌龙 — jankulveit · 2026-09-26
- 三篇论文一个信号:1% 合成数据即可引发强模型坍塌,大模型反而放大 — suchenzang · 2026-09-26