研究称共享专家架构或损害中文开源模型后训练对齐性

一位从事可解释性研究的作者在预训练提案中提出理论:中文开源模型中常见的共享专家(shared experts)架构可能降低后训练的有效性与模型可对齐性。作者进行了溯源分析,未发现该架构带来规模化收益的证据,并推测其可能对后训练对齐过程产生负面影响。这一观点引发讨论,为 MoE 架构设计与对齐研究的交叉领域提供了新的思考方向。

2026-10-07 ~ 2026-10-07 · 2 条相关