John Schulman 回忆:OpenAI 早期曾不看好 next-token prediction

AndrewDai · x · 2026-09-12

Andrew Dai 转引 Dwarkesh Patel 与 John Schulman 的访谈讨论:Schulman 透露在 OpenAI 早期,他并不认为 next-token prediction 能通向智能,因为信号会被噪声淹没。

Andrew Dai 对此评论:next-token prediction 之所以有效,不是因为它精确模拟了人脑的学习方式,而是因为它是少数几个能随规模扩展(scale)的目标函数之一,这一点是其他很多目标做不到的。

讨论的核心洞见是:哪些技术能带来分布外泛化(ood generalization),历来很难在事前预判——连 Schulman 这样的核心研究者当年也判断错了。这与「LLM 只是模仿人脑」的流行说法形成对照:可扩展性才是它胜出的真正原因。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →