六亿参数就能在心理学数据上匹配七百亿 Centaur,泛化才看规模

Small Foundation Models of Human Cognition and Behaviour

Nick Oh, Fernand Gobet

COLM'26

cs.AI, cs.CY

2026-08-05

在 1070 万条心理学试次(Psych-101)上微调 14 个 135M 到 14B 的模型发现:分布内规模几乎不影响预测,适配器秩提一提,0.6B 就能匹配 70B 的 Centaur;只在没见过的实验上大模型的优势才回来。把提示里的刺激与反馈内容遮掉,模型损失 75.7% 的信息、跌到随机以下,说明它真在用实验内容而非只靠选择序列的统计捷径。

这篇在解决什么

2025 年的 Centaur 把 Llama-3.1-70B 在 Psych-101(160 个心理学实验、1070 万条试次级选择)上微调,做出了一个能预测人类行为的「认知代理」,在见过的实验上比专门的认知模型还准。这开了个新范式,但留下两个问题:真需要 700 亿参数吗?这些模型到底学到了任务结构,还是在选择序列里捡统计捷径?

这篇(COLM'26)同时回答这两个问题:训了 14 个 135M 到 14B 的 base 模型(分属 Qwen3、Llama-3、SmolLM、OLMo 四族),再把提示拆成四个信息通道做结构性消融。

方法

训练:在 Psych-101 上做 rank-stabilized LoRA(秩扫到 4 到 64),单卡 A100,只对人类选择 token 算交叉熵,数据集大小也单独扫。

评估两条线:Psych-101(分布内,预测没见过的参与者)、Psych-201-RT(分布外,18 个全新实验)。

诊断的关键在把提示拆解。作者把每个提示分成四个通道:任务指令 I、实验刺激 S、结果反馈 F、选择历史 C,然后做四档消融:原始、去掉指令、遮蔽内容(把刺激和反馈换成占位符但保留排版)、只留选择历史。这样能区分「模型在用内容」还是「只在用排版模板」。再用试次顺序打乱测它是否理解任务的可交换性结构。

结果

分布内,规模几乎不重要。微调带来的提升约是规模提升的十倍:Qwen3-0.6B 微调后从 0.731 降到 0.528 nats(提升 0.203),而从 0.6B 放大到 14B 只再降 0.019。适配器秩能换参数:Qwentaur-0.6B 在秩 64(0.513)能匹配 Qwentaur-14B 在秩 4(0.516),少用 23 倍参数。追平 Centaur-70B 所需的规模随秩下降:秩 4 要 8B,秩 32 起只要 0.6B。

分布外,规模优势回来:

设置八个匹配模型的成绩带
Psych-101(分布内)0.028 nats(0.509 到 0.537)
Psych-201-RT(分布外)0.244 nats(0.788 到 1.033)

微调后,分布内的规模优势几乎消失(0.014、0.026),分布外的优势基本保留(0.104、0.172)。换句话说,放大模型换的不是对 Psych-101 拟合得更好,而是泛化得更远。

消融证明模型确实在用实验内容:信息保留率从原始(1.00)到去指令(0.84)到遮蔽内容(负 0.12)到只留历史(负 0.26),每步都显著。按贡献拆分,刺激与反馈的内容占 75.7%,指令占 12.5%,模板占 11.7%。遮掉内容把模型推到随机以下,「只靠选择历史」的捷径假设不成立。顺序打乱测试里,对试次独立的任务模型给出顺序无关预测,对自适应任务则保持敏感,符合设计要求。

为什么重要

对做认知与行为建模的人,实际结论是:不用非得上 70B,0.6B 到 8B 加够适配器秩,在见过的范式内就够用,省下的算力可以用来扩大范式覆盖。对方法论的贡献更大:作者把这些模型定位成「噪声上限估计器」,它给出「这个范式里人类行为有多少是可预测的」这条经验上限,从而标出现有可解释理论还差在哪。它不是认知理论(不像 ACT-R、Soar 那样有架构和机制),但作为测量工具有用。

局限与存疑

作者坦承几条:数据子集是按参与者会话切的(测的是「深度」即每实验更多人,不是「广度」即更多不同范式),广度的回报没测;参与者嵌套在实验里,没法做跨实验的人与任务分解;全部是 dense decoder-only transformer 加 LoRA,全量微调和 MoE、SSM 架构没试。还有一点:所有结论锚定在 Psych-101 这一个数据源和「下一个选择」这个监督目标上,「噪声上限」本身可能部分是方法的天花板而非数据的天花板,作者自己也提了但没有拆开。

术语

原文与代码

相关论文

全部论文解读