清华斯坦福定位 LLM 奖励子系统:价值神经元与多巴胺神经元
jiqizhixin · x · 2026-10-01
- 清华大学与斯坦福大学合作研究在 LLM 内部定位出「奖励子系统」:与奖励相关的信息并非均匀分布在全部隐藏状态中,而是集中在少数神经元里。
- 研究发现两类神经元:价值神经元编码当前状态的期望价值,即从该推理状态继续能否最终得出正确答案的概率;多巴胺神经元编码逐步的时序差分(TD)误差,即每步推理后模型对答对概率的期望变化,类似生物强化学习中的多巴胺信号。
- 隐藏状态本身已包含答案正确性、置信度与奖励信号,这项工作回答了这些信号在内部如何组织与分布的问题,对可解释性与内部监控有直接意义。
「研究」频道最新
- RSIGame 递归自我改进训练 Agent,Qwen-27B 超越 GPT-5.5 且省 11 倍 token — RSIGame · 2026-10-01
- CoEvoWhen 策略-工具协同进化,搞定超长视频时间定位还省视觉 token — zju · 2026-10-01
- 北大 DC-SAE 实现 32 倍压缩,扩散训练收敛更快更省 — DAGroup-PKU · 2026-10-01
- DuoOPD 双结局策略蒸馏,Qwen3 上较 OPD 提升 5.98 个百分点 — Ao Yu · 2026-10-01
- RIDE:在表示空间外推 RL 方向,让蒸馏学生模型逼近或超越 RL 教师模型 — Hao Li · 2026-10-01
- KRAFTON 发布 GameSpec-Bench:100 份游戏设计文档考验 Agent 忠实度 — KRAFTON · 2026-10-01