独立训练的模型也会长出“通用”注意力头?新研究揭示神经元可预测演化
CSProfKGD · x · 2026-08-05
一条推文引用了 @nikhil07prakash 的发现:独立训练的语言模型可能发展出“通用”注意力头,这一灵感来自 @AmilDravid 关于独立训练神经网络发展出“通用神经元”(Rosetta Neurons)的发现。
@AmilDravid 的引用推文指出,缩放定律描述了损失如何随规模变化,但模型内部的神经元是否也随规模可预测地变化?他们研究了高达 30B 参数的视觉和语言模型,发现了神经元通用性、特化性和选择性的系统性缩放。论文和代码已发布。
「研究」频道最新
- 微软研究院提出决策分析引导法,让 LLM 安全应对医疗高风险决策 — brwilder · 2026-08-05
- ECCV 2026 论文发布百万级关键点数据集与通用检测模型 GKDT — NielsRogge · 2026-08-05
- 斯坦福论文剖析 VLA 模型在复杂操控任务中的失效机制 — StanfordAILab · 2026-08-05
- NeurIPS 审稿期遭遇异常沉默,作者与审稿人集体潜水? — RevolutionaryPea8272 · 2026-08-05
- AI Scientist 夏季研讨会公布议程:聚焦可靠性与闭环发现 — nc_frey · 2026-08-05
- 深度解析:为什么大模型思维链(CoT)能生效? — NaveenGRao · 2026-08-05