Sparse Reward Subsystem in Large Language Models
Guowei Xu, Mert Yuksekgonul, James Zou
cs.CL
2026-02-01
清华和斯坦福用探针剪枝发现,不到1%的神经元就编码状态价值与逐步TD误差,清零这1%后Qwen-2.5-7B在MATH500上的准确率从75.2%平均跌到20.3%。
已有工作在隐藏状态上接一个小网络(探针),能读出这道题会不会做对,但维度全用上,看不出信号落在哪。奖励若只占很少的坐标,置信度和过程奖励就可以少读很多维。
自回归 LLM 被看成一条还没写完的推理轨迹。状态价值 V(st) 就是从当前前缀继续生成、最终做对的概率。最大熵强化学习里,最优策略的对数概率正比于优势,强策略和价值函数绑在一起。预测二元对错,信息论上一个标量就够。叠加假说则预期,这种全程用得到的特征会落到稀疏神经元上。论文标明这是动机,不是证明。
找法分两步。先训两层 MLP 探针,再按第一层输入权重的 L1 范数剪掉不重要的隐藏维度。价值探针隐层宽 1024,多巴胺探针隐层宽 32。
价值神经元读状态价值。损失是时序差分(TD)误差的平方,中间步取相邻价值之差,末步换成真实对错。折扣 γ 取 1-1e-5,几乎不折扣。评测放在 s0,题目读完、答案尚未生成,指标是预测价值对最终对错的 AUC。剪到只剩不到 1% 的维度,AUC 仍不掉,这些维度就是价值神经元。
多巴胺神经元借名自生物里编码预测误差的细胞,读的是步骤级奖励预测误差。回答按段落切开,段边界用蒙特卡洛续写估计价值,δ 等于折扣后的价值跳变。探针只在绝对跳变大于 0.3 的段落上训练和评测。隐藏状态在该条回复内标准化后按段落平均。指标是与蒙特卡洛跳变的 Spearman 排序相关。
Qwen-2.5-7B-SimpleRL-Zoo 上做了清零:单层关掉价值探针挑出的 top 1% 激活。对照是随机清零、按 MLP downproj 权重幅度清零、Wanda(按权重与激活打分的剪枝基线)的 top 1%,以及用下一词预测训出的探针所挑的 top 1%。
Qwen-2.5-14B-SimpleRL-Zoo 第 2 到 4 层,GSM8K 和 MATH500 上的 AUC 随剪枝几乎不降。MATH500、ARC、代码集 MBPP+、指令跟随 IFEval,以及 Qwen3.5-0.8B、Phi-3.5-mini、Llama-3.1-8B-Instruct 上都有同一模式。s0 的绝对 AUC 只到中等。改看回复最后一个 token,四个模型在 Minerva Math 上的 AUC 大多稳定在 0.8 以上。
清零前 MATH500 准确率 75.2%。
| 层 | 价值神经元 | 随机 | 下一词探针 | 幅度 | Wanda |
| 2 | 37.0 | 77.0 | 76.4 | 74.6 | 74.8 |
| 3 | 13.6 | 73.4 | 76.8 | 61.6 | 48.2 |
| 4 | 29.4 | 73.8 | 77.4 | 75.4 | 67.0 |
| 5 | 1.2 | 74.4 | 75.2 | 75.0 | 73.4 |
| 平均 | 20.3 | 74.6 | 76.4 | 71.6 | 65.8 |
价值神经元平均掉 54.9 个点,随机掉 0.6,下一词探针涨 1.2,幅度掉 3.6,Wanda 掉 9.4。第 5 层从 75.2% 掉到 1.2%。与下一词神经元重叠 0.7%,随机基线 0.5%。改用终局奖励而不是 TD 误差来定位,同样清掉 1%,平均只掉到 66.4%。
14B 第 3 层上,GSM8K、MATH500、ARC 的价值神经元交并比(IoU)高于随机,越剪到只剩关键坐标越重合。同一底座、用可验证奖励微调的 SimpleRL-Zoo 与 PPO-Zero 也高于随机。跨模型族只验证了这类神经元存在,没有比位置。
多巴胺探针在 7B 第 20 到 22 层、14B 第 15 到 17 层上,Spearman 在大段剪枝区间里基本走平。正文没给汇总相关系数,图纵轴止于 0.4。第 5 层第 1517 号神经元在关键步出尖峰,在写错处出低谷。清掉更早层 top 20% 价值神经元后峰谷错位。清掉同样比例的随机神经元则几乎不动。
置信度上,四模型在 MATH500 与 ARC 上,价值神经元取最优剪枝比、再对第 2 到 4 层平均,AUC 0.67。全维线性探针 LCD 为 0.60,口头置信度 0.52,下一 token 对数概率 0.48,题目长度 0.62。平均最高,不是每格都最高。Qwen3.5-0.8B 的 MATH500 上,题目长度 0.77,价值神经元 0.71。
过程奖励上,同一 7B 在 MATH500 验证子集做段级搜索,每段抽 4 个候选,由多巴胺探针选最高分。三次种子平均 77.8%。贪心 72.2%,随机挑候选也是 72.2%,用 log πRL - log πbase 近似的隐式过程奖励 75.0%。没有外部过程奖励模型对照。
奖励信号落到了可点名的少量神经元上,清掉会伤推理,早期价值神经元还牵着后面的多巴胺神经元。价值读数能在开写前当置信度。多巴胺读数能当内部过程奖励。4 个候选的搜索里,它比隐式奖励高 2.8 个点,比贪心高 5.6 个点。
改进是渐进的。置信度比题目长度平均只高 0.05 的 AUC,比全维线性探针高 0.07。定位这些神经元仍然要靠带对错标签的轨迹。
论文承认两条。要有环境给的奖励,开放生成这种难打分的任务没测。没有检查超过 32B 的模型,正文实验最大到 14B。
名字是类比。生物价值神经元编码主观价值,多巴胺神经元编码奖励预测误差。这里只是隐藏维度的激活与价值或 TD 误差对齐。论文没有主张模型在感受奖励。
清零 1% 就崩,也可能这些坐标承担着早期层的关键计算,奖励是顺带读出的量。下一词探针几乎无害,Wanda 平均只掉 9.4 个点,替代解释被压窄,但第 3 层 Wanda 自己掉 27 个点。坐标由这一套探针权重定义,换架构是否换一批,论文没报。重叠只比随机高 0.2 个百分点。
多巴胺证据更软。正文没有 Spearman 汇总,案例主要是第 1517 号神经元。绝对误差不超过 0.3 的步骤被事先丢掉,只在价值已明显跳动的段落上测。置信度用了最优剪枝比,搜索没有外部过程奖励模型,生成前 AUC 仍是中等。