Rosetta 神经元研究获 COLM 工作坊最佳论文:规模越大越单一语义
yasamanbb · x · 2026-10-11
Google 研究者 Amil Dravid、Yasaman Bahri、Alexei Efros、Yossi Gandelsman 的论文《Neuron Populations Exhibit Divergent Selectivity with Scale》获 COLM Sci-FM 工作坊最佳论文奖。研究将 scaling law 从 loss 等宏观指标延伸到神经元层面:
- 研究对象是 Rosetta Neurons——在不同独立训练模型中激活模式相似的神经元,覆盖最高 30B 参数的语言模型和 5B 参数的视觉模型。
- 发现其数量随模型规模呈亚线性幂律增长:绝对数量增加,但占总神经元比例持续缩小。
- 提出「神经元极化效应」:Rosetta Neurons 随规模变得更 selective、更单一语义,与其余越来越不 selective 的非 Rosetta 群体分化。
- 一个权衡特征效用与有限神经元容量的分析模型可解释亚线性幂律与极化效应。
- Rosetta Neurons 随规模变得更领域专用,并通过一个面向继续预训练的定向数据过滤案例展示其选择性。
结论指向可解释的、共享的神经元级结构的 scaling law,把模型规模与神经元的普适性、选择性和专业化系统性地联系起来。
「模型」频道最新
- 阿里披露 Qwen 已连续跑 RSI 一个多月,Qwen 4.0 全系深度自进化 — teortaxesTex · 2026-10-11
- 新 Claude 只记得 Opus 3 弃用公告,却不知它仍可研究访问 — repligate · 2026-10-11
- Tavus Griffin 数字人骗过 48% 面试者,受骗者信心不减 — lulzxdxdxd · 2026-10-11
- 多 harness 强化学习兴起,Kimi、DeepSeek 等混用训练 — zainhas · 2026-10-11
- 用户实测:Claude 20X 速度如 API 般丝滑,OpenAI 首 token 反应变慢 — ryunuck · 2026-10-11
- 用户吐槽 GPT-6.1 网页设计倒退:全是一个模板的 AI slop — JadeSerpant · 2026-10-11