训练时不教「0」,模型就发现不了零,但语言预训练能把学习样本省一半

2026-08-04

普林斯顿让 GPT-2 级模型只学无零算术,测试时无一能凭空发现零;语言预训练则把学会零所需的样本省掉约 48.5%(p≈1.7e-4)。

这篇在解决什么

IMO 拿金牌、Putnam 解 8/12、Erdős 问题被推进,过去一年 OpenAI 和 DeepMind 的「推理模型」把 AI 在数学上的表现推到了让人侧目的地步,「证明自动化之后数学家干什么」已经成了被认真讨论的话题。这篇论文(普林斯顿,作者含认知科学家 Thomas Griffiths 和 Brenden Lake)问的是个更根本、也更少人碰的问题:这些模型到底能不能越过训练数据,自己提出一个全新的数学概念?它选了可能最小的测试用例:零。

零这个概念在人类历史上得来不易。巴比伦人公元前 1800 年就用占位符区分 3601 和 61,但把零当成一个「数」对待,要等到公元 628 年婆罗摩笈多的形式化定义,前后花了 2400 多年。认知科学一直有个假设:语言能力是这类概念跃迁的脚手架,孩子先用语言搭起占位符,再用经验把它打磨成正式概念。作者把这个假设搬到了神经网络身上。

方法

实验设计干净到能当教科书。核心一句话:只在不含零的算术上训练,测试时看模型能不能处理含零的算术。

数据是单数字加减法,2 到 4 个操作数,如「3+4-2=5」。切分的讲究是全部关键:凡是零出现在等号左边、或零本身就是答案的题,统统进测试集;但答案个位是零的题(如「5+5=10」)留在训练集。配合逐位 token 化(「10」拆成「1」「0」),模型确实见过「0」这个 token,它占训练标签的 2.5%,只是从没见过零作为独立答案或操作数。这样就把「没见过 0」和「真不懂 0」分开了。

模型是 GPT 架构,主战场是 GPT-2 体量(12 层、1.24 亿参数),外加一个 80 万参数的小模型。这类研究最大的混淆是「语言预训练其实偷偷见过算术」,所以作者自建了一个「无数学」版 OpenWebText:数字全改成数词(「100%」→「one hundred percent」),删掉一切带 + = 之类符号的文本,只剩 45.1% 的文档。困惑度曲线证实,在这个语料上预训练的模型对算术确实两眼一抹黑。

三组实验:零样本(完全不给零)、少样本(往训练集掺 1 到 1024 个含零例子)、以及「零是不是特殊的」(把 1 到 9 轮流 hold out,再做八进制版对照)。

结果

最干净的负结果:没有一个模型能在测试时凭空发现零。四个配置(预训练或不预训练、大或小)的训练损失层次分明,见过算术的预训练模型损失最低,但随着训练损失下降、验证准确率饱和,含零测试题的准确率纹丝不动。附录里更大的 Llama-3.2-1B 和 Pythia-1B(10 亿参数;为排除它们预训练见过算术的干扰,实验给数字换了全新 token)也一样造不出零。

喂一点点含零样本,局面就变了。对预训练过的 GPT-2:

模型含零样本含零准确率
预训练 GPT-264 个(0.64%)>60%
预训练 GPT-21024 个(10.24%)>90%

最有意思的数字在样本效率上:有语言预训练的模型,学会零所需的例子比没有预训练的少 48.5%(自助法 95% 置信区间 41.2–55.9%,5 个随机种子;t 检验 p = 1.7×10⁻⁴)。这是「语言脚手架概念发现」这个认知科学假说拿到的第一个定量神经证据。

零到底特不特殊?第三组实验说:不算唯一特殊,但处在难度顶端。中间的数字(4、5、6)最好泛化,难度向两端递增,零和进位数字(十进制是 9,八进制是 7)最难。八进制里 7 同样难,说明难的不是 9 这个数字本身,而是它触发的进位操作。作者的解释是模型擅长内插、不擅长外推:中间数字在表征空间里近邻更多(余弦相似度 ≥0.65 的邻居数呈倒 V 形),0 和 9 处在边界,邻居少。

错误分析里还有个细节:零被 hold out 时,模型最常吐出的替代答案是 −1(占 RHS 错误的 59.13%),其次是 1。

为什么重要

对从业者来说,「小模型泛化差」算不上意外,这篇真正的价值有两点。

第一,它给「AI 即将自主产出新数学」这股叙事划了条清楚的边界。IMO 金牌、Putnam 高分都是在和训练数据同分布的题上拿的;真正的数学发现要求越过分布边界、提出全新结构。论文证明,连发现零这种最小限度的概念跃迁,现有模型在测试时都做不到,把模型放大到 10 亿参数也无济于事。benchmark 分数和「能做新数学」之间,隔着一条还没人跨过的沟。

第二,48.5% 那个数字是能直接用的工程信号:想让模型 grasp 一个训练分布里没有的新概念,给它扎实的语言预训练,能让你用大约一半的标注样本就教会它。方法上,他们那套「无数学语料 + 逐位 token + 受控暴露 0 token」的协议本身就是一个可复用的概念泛化基准,比再刷一个 MATH 分数有意义。

局限与存疑

作者自己点了几条:只测了 GPT-2 这一种架构,没碰推理、思维链、scratchpad 这类能显著抬升多步推理的训练技巧,而这些可能正是发现零需要的;模型和数据规模都小,他们承认规模本身可能就是负结果的部分原因(附录两个 1B 模型仍是负结果,但更大模型未测);错误分析只跑了单个随机种子。

读完还有两点存疑。其一,48.5% 的样本节省是在一个故意构造的玩具任务上测的,它能不能外推到真实的概念学习(比如让模型学一个训练语料里没有的新科学概念),论文没给任何证据。其二,论文证明了语言预训练有用,但到底有用在哪完全是黑箱:是模型从语言里迁移了「nothing」之类概念,还是别的什么机制,作者也说不清,明确把它留给后续工作。换句话说,「语言脚手架概念发现」目前只是一个被佐证的相关性,机制仍是空的。

术语

原文与代码

社区讨论

全部论文解读