北大清华用任务fMRI给LLM纠错,命题推理最高涨13个点

2026-08-23

北大清华用10人任务fMRI对齐并改写LLM中间表征。十个1.5B到72B模型上,相对纯语言监督平均再涨2.2个点,Mistral-7B命题推理最高再涨13.2。

这篇在解决什么

LLM 能解一部分逻辑题,题目一换词、一打乱前提顺序,正确率就会掉。人脑里,演绎推理主要走额顶网络,和经典语言区基本分开。所以答对了,并不等于内部在走和人一样的推理回路。

北大、清华和微软亚洲研究院把问题拆成两段。第一段:开源 LLM 的中间表征,能不能预测人在做三段论、传递推理时的任务 fMRI。第二段:如果对得上一部分,这些脑信号能不能反过来当方向,把模型答错的表征推回正确侧。对齐分数只是入场券。真正要看的是纠错率和出分布泛化。

方法

fMRI 来自 OpenNeuro ds003076。筛选后剩 10 名 19-30 岁被试、70 道题,刺激全是假词和虚构人名,降低语义记忆作弊。人的平均正确率 86.4%。对照 10 个指令模型,从 Qwen2-1.5B 到 Llama3.3-70B,同一套题从 71.4% 到 97.1%。

对齐用 neural predictivity:先对比「做推理」和「只读前提」,取出对推理敏感的模型单元,再用 ridge 回归预测体素,除以人类之间能解释的方差上限。推理区这个上限约 0.257。

改模型的两条路径叫 NARI 和 NARF。每一层学一个 hidden state 到 fMRI 的线性编码器 W。只在模型答错、人答对的题上,沿最大化 Sim(Wx, y) 的梯度推表征。计算时丢掉截距,等于额外吃进两边均值之间的系统偏差。NARI 在推理时改中间约 1/4 到 3/4 层的注意力输出,扰动卡在 ασ 以内,最多 200 步;成功方向再平均成通用向量。NARF 要么把成功干预点当回归目标,要么把负相似度直接加进 True/False 交叉熵,LoRA 只动那些中间层注意力。

结果

10 个模型平均能解释推理区 75.9% 的可解释方差,语言区只有 65.1%。按三段论或传递推理拆开,分数掉到约 26.8% 和 28.4%。未训练权重明显更低;中间层和注意力输出更对齐。聚合高、分型低,主要因为两类题在表征空间里已经分开,模型只要抓住题型差就能刷聚合分。

NARI 在 6 个仍会犯错的模型上,实例级纠错成功率 100%,随机 fMRI 和随机方向都差一截。推理区信号优于多重需求网络和语言区。平均成功方向能搬到新题,但 Qwen2-7B 和 Mistral-7B 搬不动。DeepSeek-R1-Distill-Qwen-1.5B 的思维链文本也能被改口。

NARF 单独微调后,Mistral-7B 在打乱前提顺序的三前提测试上从 75.9% 升到 88.0%,六前提从 56.6% 到 78.9%。和语言标签合训,10 个模型相对纯标签平均再涨 2.2 个点,区间 0.5 到 6.4;Llama2-7B 是上限那头。Mistral-7B 在命题推理上,五次运行最大值从 70.5% 到 83.7%。70B 附近已经贴天花板,Llama3.3-70B 只从 93.92% 到 94.44%,Qwen2-72B 的差异未过显著阈值。FOLIO 上并不整齐:Qwen2-1.5B 从 77.9% 到 83.2%,Llama3-8B 反而从 90.7% 掉到 89.8%。HCP 关系推理任务上实例干预成功率大约 80%。MMLU、GSM8K、HumanEval、MBPP 基本不动。

为什么重要

NeuroAI 常见做法停在脑分数。这篇把任务 fMRI 做成表征级监督,和最终 token 的交叉熵正交。语言标签主要塑最后一层,NARF 在层间轨迹上把对、错逻辑分开。没有任务 fMRI,这套流程搬不走。能拿走的判断是:小模型、假词逻辑题上,脑信号提供的增益补的是语言监督补不到的中间过程。它不是通用推理训练方案,也替代不了规模和数据。

局限与存疑

实例级 100% 说的是「在 bounded 范围内找得到一条能翻盘的方向」,最多试 200 步,不是一条固定向量随手一加。对已经答对的题做同样操作,α=10 时平均 37.6% 会翻成错。fMRI 是秒级血氧,跟不上思维链中间步骤,作者把希望寄在 MEG 或 EEG。训练只有 70 道题、10 个被试,被试间成功率 52% 到 86%。Qwen2-1.5B 单独 NARF 后命题推理从 47% 掉到 45.2%;Qwen2-7B 原本 97%,没有上升空间。方法还要求人答对、模型答错的配对。70B 的增益落在噪声边沿。

术语

原文与代码

社区讨论

全部论文解读