斯坦福清华称发现 LLM 内类多巴胺奖励神经元
斯坦福与清华的联合论文宣称,在大语言模型的隐状态中自发涌现出生物学风格的奖励子系统:不到 1% 的稀疏神经元承担了模型自我修正的主要功能,其中「价值神经元」的作用类似人类前额叶皮层,参与下一个词的生成与评估。不过也有学者批评,将模型内部机制类比为生物多巴胺系统属于过度炒作,可能夸大了这一发现的生物学意义。
2026-09-22 ~ 2026-09-22 · 2 条相关
- 斯坦福清华研究:LLM 隐状态中自发涌现类多巴胺奖励神经元 — chrismattmann · 2026-09-22
- 斯坦福清华称发现 LLM 内「多巴胺神经元」,学者批类比生物学过度炒作 — aran_nayebi · 2026-09-22