蒸馏贝叶斯再对人微调,BBT四项概念学习全面胜过原模型

More accurate behavioral predictions with hybrid Bayesian-connectionist models

Brenden M. Lake, Akshay K. Jagadish, Guangyuan Jiang

cs.LG

2026-08-23

把贝叶斯模型蒸馏进30M Transformer,再用人行为微调。四个概念学习任务上,BBT的对数似然全面超过纯贝叶斯、只蒸馏和只微调。

这篇在解决什么

认知建模长期卡在两个工具箱之间。贝叶斯模型擅长把规则、程序、语法这类结构化先验写进去,少样本推理也自然;但假设空间和参数形式是硬编码,人的捷径和偏差很难塞进去,后验预测还常常要对假设空间求和,算不动。神经网络反过来:表达力够、前向一次就出预测,归纳偏置却不透明,实验室又往往只有几百个被试。直接训会过拟合,也学不到人那种看几个例子就下判断的能力。

普林斯顿的 Lake、Jagadish 和 MIT 的 Jiang 把两段接起来:先把贝叶斯模型蒸馏进网络,再用人的反应微调。这套流程叫 Bayesian distillation with Behavioral Tuning,简称 BBT。它是拟合程序,不是发展心理学主张。

方法

BBT 的输入是一个学习回合:一组已观察的输入-输出对,加上一个查询,网络预测人会怎么答。骨干是约三千万参数的 encoder-decoder Transformer,两边各 4 层、8 头、512 维,四个案例共用。

第一阶段只吃合成数据。从先验抽一个假设,再按似然生成输入-输出对,网络去拟合后验预测分布:见过这组例子之后,下一个输入更可能贴哪张标签。只要前向采样,不必做后验推断。蒸馏成功后,一次前向就能近似对全体假设的求和。数字游戏上,蒸馏网络与原贝叶斯模型在 51 个留出集合、5100 个查询上的相关达到 0.997。

第二阶段把同一套权重拿到人的行为上微调,留下验证损失最好的 checkpoint。这一步不再受原来的先验、似然、甚至贝叶斯更新约束。人如果用更简单的规则、一对一映射、或假设空间里没有的捷径,网络都可以跟着走。对照拆成只蒸馏、只微调、两段都做。

结果

四个案例都是经典概念学习,对数似然越高越好:

模型数字游戏逻辑概念Shepard 概念组合指令
贝叶斯-31332.6-79023.3-5554.4未实现
只蒸馏-31435.7-77249.9-5601.1-466.4
只微调-31465.2-106926.3-5924.7-1653.6
BBT-28157.9-69423.8-5260.8-343.6

组合指令没有单独做贝叶斯推断,蒸馏网络本身就是近似。只微调四个任务都垫底:这点行为数据撑不起三千万参数,先验蒸馏是在补数据。

数字游戏里,BBT 与人类「是/否」比例的 Pearson r 是 0.81,RMSE 0.153;原贝叶斯是 0.66 和 0.302。把贝叶斯模型自己当可微网络微调也不够。放开 5084 个假设的先验,r 只有 0.67;再把每个假设的似然放开到约 51 万参数,r 到 0.78,仍比 BBT 差 578.8 个自然对数点。人看到 {66, 78} 更像「偶数」而不是「6 的倍数」;BBT 把「偶数」权重抬到 0.46,原模型只有 0.05。

逻辑概念上,BBT 比 Piantadosi 等人 21 个贝叶斯模型里最好的那个还多至少 7826 个对数点。对最后 8 组物体,r 从只蒸馏的 0.87 到 0.88,RMSE 从 0.214 降到 0.190。人平均正确率 78%,两个网络在真值规则上却都是 69%。多出来的拟合不在猜对规则,而在人会退回更简单的特征假设。微调后,最匹配的假设平均少 2.2 次函数调用。11 个微调时没见过的概念上,第二阶段仍能把预训练网络再抬至少 481.7 个对数点。

Shepard 任务有记忆负担,先前试次不会一直留在屏幕上。BBT 额外学了块编号和年龄组 embedding。学习曲线与人的相关是 0.938,只微调几乎是平的,r 只有 0.022。年轻组模拟正确率 86.9%、年长组 77.7%,人是 78.6% 和 65.9%,方向对、绝对值偏高。用 Lewandowsky 数据微调、去预测六年后 Badham 实验的留出被试,对数似然 -5331.1,和在 Badham 训练集上微调的 -5298.7 接近。第一块结束时,Type I 单特征规则的占比从蒸馏后的 0.02 升到年轻组 0.17、年长组 0.05。

组合指令要一次学会几条改写规则。原实验 23 人里,80.7% 的回答符合设计好的符号系统,剩下近两成是别的模式。这篇新收了 166 人、8 套规则。BBT 比只蒸馏多 122.8 个对数点,也略好于此前手工加偏差的模型,-343.6 对 -349.2。人的错误里 24.4% 是一对一映射、23.3% 是图像性拼接;BBT 分别是 44.4% 和 7.0%,只蒸馏是 10.4% 和 0%。偏差方向对上了,比例还没对齐。

为什么重要

给认知建模的人,这是一条可复用的配方:先验用贝叶斯的语言写,预测用网络的前向,对人数据的偏离交给微调。三千万参数、一百多人的数据也能训,前提是合成数据先把假设空间的逻辑灌进去。四个案例都在「从几个例子推出规则」这条线上,而且写得很清楚:只靠行为数据微调,大网络会垮;只蒸馏,又拟合不上人的捷径。

和直接拿大语言模型当认知模型相比,BBT 的训练数据是受控的。蒸馏阶段在学任务本身,上下文里不塞前人的整段反应序列。解释更干净,换来的是任务专用、没有世界知识。这是渐进的方法贡献,不是新的认知理论。

局限与存疑

作者自己划了几条。两阶段流程不是发展心理学主张,别读成小孩先近似贝叶斯再被经验拉走。解释微调后的网络,选哪一层、哪些回合、哪些变量,都是分析者的选择。稀疏分解只能在原贝叶斯的假设上重新加权,人若用了假设空间里没有的东西,这一步会漏掉。非正式试验里更宽的先验、更干净的似然更好蒸馏,系统比较还没有。

数字也有对不上的地方。数字游戏上人对「80 多」的整体偏好,BBT 没跟上。Shepard 上模型正确率系统高于人。组合指令里一对一偏差被放大、图像性拼接被缩小。四个任务都是实验室概念学习,离自然范畴还远。源码声称在 GitHub,论文正文没给仓库地址。

术语

原文与代码

社区讨论

相关论文

全部论文解读