斯坦福清华研究:LLM 隐状态中自发涌现类多巴胺奖励神经元
chrismattmann · x · 2026-09-22
据转述,斯坦福与清华的论文称在大模型内部发现了生物学风格的奖励子系统:不到 1% 的高度稀疏神经元承担了自我校正的主要工作,其中「价值神经元」类似人类前额叶皮层,在模型生成下一个词之前就点亮,指示模型对当前状态的预期价值与置信水平;另一类则对应生物多巴胺神经元。研究者强调这不是人为设计的,而是训练中自然涌现的。原帖为较长论文解读线程的开头,正文被截断。
「研究」频道最新
- O'Reilly 撰文拆解 AI 时代数据词汇:从数据仓库到本体论 — rseroter · 2026-09-22
- 神经科学团队升级动力学相似性分析 DSA,速度大幅提升且更通用 — GretaTuckute · 2026-09-22
- Glance:4B 开源 VLM 不生成直接读答案,省 85% GPU 成本 — multiply_matrix · 2026-09-22
- krea2-bbox-turbo 微调进行至 epoch 14,计划训到 20 后开源 — Amazing_Painter_7692 · 2026-09-22
- OpenAI 成立数学顾问组,其 AI 已解决逾百个数学开放问题 — TechCrunch AI · 2026-09-22
- SkillLift 用学习式评分替代真实 rollout,agent 技能进化省 40-70% token — dair_ai · 2026-09-22