独立训练的模型也会长出“通用”注意力头?新研究揭示神经元可预测演化

CSProfKGD · x · 2026-08-05

一条推文引用了 @nikhil07prakash 的发现:独立训练的语言模型可能发展出“通用”注意力头,这一灵感来自 @AmilDravid 关于独立训练神经网络发展出“通用神经元”(Rosetta Neurons)的发现。

@AmilDravid 的引用推文指出,缩放定律描述了损失如何随规模变化,但模型内部的神经元是否也随规模可预测地变化?他们研究了高达 30B 参数的视觉和语言模型,发现了神经元通用性、特化性和选择性的系统性缩放。论文和代码已发布。

所属事件:新研究揭示跨模型存在通用注意力头(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →