零数据自博弈预训练:模型自造数据也能涌现泛化

burny_tech · x · 2026-09-27

特拉维夫大学、斯坦福等机构的论文 《Self-Play Pretraining with Zero Data》 提出「零数据预训练」概念:不再依赖人工筛选的训练语料,而是让模型通过自博弈自己生成最有用的训练数据。

方法上,从随机初始化开始同步训练两个模型:一个生成器在通用图灵机上提出程序、生成字节序列,一个学习器用标准 next-token 交叉熵预测这些序列;生成器再用 RL 更新,专门挑学习器能力边界上的序列——既非已掌握也非纯随机,形成自适应课程。这相当于在「所有可计算结构」的空间里做搜索(灵感来自 Solomonoff 归纳)。

结果:学习器从未接触任何自然数据,却在未见过的文本、图像、音频和代码上零样本损失改善,甚至发展出 in-context learning,且零样本性能随自博弈算力呈可预测的 scaling 规律。这表明一种通用的预测性结构,可能仅从自生成的计算中就能被发现,训练数据瓶颈或可被算力取代。

所属事件:斯坦福等提出零数据自博弈预训练(11 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →