追踪共享专家溯源:无规模化证据,或损害后训练对齐性
menhguin · x · 2026-10-07
作者在可解释性预训练提案中探索一个理论:中文开源模型常见的共享专家(shared experts)可能降低后训练的有效性与模型可对齐性。
核心论点:
- 溯源发现:追踪共享专家的技术脉络后发现,没有任何规模化证据表明它在前沿规模的预训练中有收益——它全部源自一篇 DeepSeek MoE 论文,之后大家照抄却都没发表验证结果。
- 机制猜想:共享专家本质上损害专家专业化,降低后训练中细粒度权重调整的精度。一个总在特定 topic/token 上激活的专家是有信息量的;但一个对所有 token 都激活的专家则是混杂因素,会阻碍专业化并让梯度调整不够精准。
所属事件:研究称共享专家架构或损害中文开源模型后训练对齐性(2 条相关)→
「研究」频道最新
- Menlo Research 开源 Asimov 1 人形机器人步态策略与训练代码 — freelerobot · 2026-10-07
- Arm 推出 ALeWM:自适应前缀长度的 JEPA 世界模型 — Arm · 2026-10-07
- 微软开源 MiniCorp:用办公室模拟器造企业级智能体数据 — microsoft · 2026-10-07
- NVIDIA NeMo-DCR:万亿参数 RL 权重同步提速 12-40 倍 — nvidia · 2026-10-07
- HLA 混合线性注意力:LongBench-V2 最高提升 5.57 分 — Monash · 2026-10-07
- ConEx 用概念感知归因生成人类可读的显著性图 — Yehonatan Elisha · 2026-10-07