自博弈从零训练的游戏 AI 强到离谱,前 DeepMind 研究员称再加 10 倍算力会更强
syhw · x · 2026-09-26
前 DeepMind 研究员 syhw 评论某款用自博弈(self-play)从零训练、完全不依赖人类数据的游戏 AI,称这就是「正道」。他判断:如果把峰值 APM 限制在 500、平均 300(接近人类水平),再加 10 倍算力训练,模型会比现在更强。观点指向纯自监督强化学习路线在复杂游戏上的天花板仍未到。
所属事件:星际自博弈 AI 引发 AGI 基准之争(4 条相关)→
「研究」频道最新
- 三篇论文一个信号:1% 合成数据即可引发强模型坍塌,大模型反而放大 — suchenzang · 2026-09-26
- 合成数据的重点正在转移:后训练里模拟将比蒸馏更重要 — realsohamparekh · 2026-09-26
- 新研究:利用多模型分歧定位专家标注,数月码本修订缩至数天 — windx0303 · 2026-09-26
- 开发者盛赞持续学习论文:AGI 定义早在 2000 年就有,却无人照此训练 — willcb · 2026-09-26
- Lawrence Krauss 播客探讨 AI 如何放大论文工厂的危害 — willcb · 2026-09-26
- 免微调让本地模型即时纠错:4096 原型池方案开源,NumPy+Java 实现 — thisdudelikesAI · 2026-09-26