零数据自博弈预训练:模型自造数据也能涌现泛化
burny_tech · x · 2026-09-27
特拉维夫大学、斯坦福等机构的论文 《Self-Play Pretraining with Zero Data》 提出「零数据预训练」概念:不再依赖人工筛选的训练语料,而是让模型通过自博弈自己生成最有用的训练数据。
方法上,从随机初始化开始同步训练两个模型:一个生成器在通用图灵机上提出程序、生成字节序列,一个学习器用标准 next-token 交叉熵预测这些序列;生成器再用 RL 更新,专门挑学习器能力边界上的序列——既非已掌握也非纯随机,形成自适应课程。这相当于在「所有可计算结构」的空间里做搜索(灵感来自 Solomonoff 归纳)。
结果:学习器从未接触任何自然数据,却在未见过的文本、图像、音频和代码上零样本损失改善,甚至发展出 in-context learning,且零样本性能随自博弈算力呈可预测的 scaling 规律。这表明一种通用的预测性结构,可能仅从自生成的计算中就能被发现,训练数据瓶颈或可被算力取代。
「研究」频道最新
- 函数梯度下降算法难题被攻克,论文入选 NeurIPS — CatAstro_Piyush · 2026-09-27
- 日语口语评测专用 ASR:莫拉标签错误率从 12.3% 降至 7.1% — tkasasagi · 2026-09-27
- kalomaze 提想:把 nanogpt 训练技巧搬到 DCT 系数上检验普适性 — kalomaze · 2026-09-27
- 本月长寿速览:AI 设计药物让 6 项衰老指标变年轻 — rand_longevity · 2026-09-27
- 猜想:单义表示完美后可免外部验证器训练编程 Agent — menhguin · 2026-09-27
- 9B 模型 80 次测试中 5 次把工具调用写成散文,评测揭示隐形失败 — Grimmoner · 2026-09-27