斯坦福自博弈预训练:零真实数据让 Transformer 学会预测
StanfordAILab · x · 2026-09-27
- 斯坦福团队提出 Self-Play Pretraining with Zero Data:两个模型均从随机初始化开始,生成器为通用图灵机提议程序,学习器在其输出上训练,全程不使用任何真实数据。
- 尽管没有见过真实数据,学习器在图像、文本、音频、旋律上的 zero-shot 验证损失随自博弈算力呈可预测的 scaling 下降,并发展出 in-context learning 能力。
- 理论动机:Transformer 可被训练去逼近 Solomonoff 归纳(理想 next-token 预测器),因此无需接触数据也能学会预测自然数据序列。
- 作者称这是概念验证(poC),由 AdityaCowsik、michaelyli、KfirDolev 共同主导,合作者包括 Noah Goodman、Yoav Levine 等。
所属事件:零数据自博弈预训练:随机初始化模型涌现泛化能力(8 条相关)→
「模型」频道最新
- Text Arena 分析:Opus 5.5 写作更像人,破折号骤降 95% — rohanpaul_ai · 2026-09-27
- 博主称 Opus 5.5 除 AGI 外还具备通用情绪智能 — ramos_casals · 2026-09-27
- Cursor Pro 周额度重置卡壳:官方称已全量重置,用户却仍遭浪费重置令牌 — ChrisUniverse · 2026-09-27
- OpenAI 宣布为所有付费用户重置 Codex 与 ChatGPT 用量额度 — reach_vb · 2026-09-27
- NY Post 曝 OpenAI 与 Anthropic 夸大 Rogue AI 事件以推动监管 — rvp · 2026-09-27
- $200 的 Codex 用户抱怨:Astra 几天烧光额度,Sol 不如 Opus 5.5 — brandon_galang · 2026-09-27