研究称共享专家架构或损害中文开源模型后训练对齐性
一位从事可解释性研究的作者在预训练提案中提出理论:中文开源模型中常见的共享专家(shared experts)架构可能降低后训练的有效性与模型可对齐性。作者进行了溯源分析,未发现该架构带来规模化收益的证据,并推测其可能对后训练对齐过程产生负面影响。这一观点引发讨论,为 MoE 架构设计与对齐研究的交叉领域提供了新的思考方向。
2026-10-07 ~ 2026-10-07 · 2 条相关
- 追踪共享专家溯源:无规模化证据,或损害后训练对齐性 — menhguin · 2026-10-07
- 研究者称共享专家或降低中国开源模型后训练对齐效果 — menhguin · 2026-10-07