斯坦福清华研究:LLM 隐状态中自发涌现类多巴胺奖励神经元

chrismattmann · x · 2026-09-22

据转述,斯坦福与清华的论文称在大模型内部发现了生物学风格的奖励子系统:不到 1% 的高度稀疏神经元承担了自我校正的主要工作,其中「价值神经元」类似人类前额叶皮层,在模型生成下一个词之前就点亮,指示模型对当前状态的预期价值与置信水平;另一类则对应生物多巴胺神经元。研究者强调这不是人为设计的,而是训练中自然涌现的。原帖为较长论文解读线程的开头,正文被截断。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →