研究者称共享专家或降低中国开源模型后训练对齐效果

menhguin · x · 2026-10-07

一位做可解释性研究的作者在讨论中透露,他们在 interp 预训练提案中探索的一个理论是:中文开源模型中常见的共享专家(shared experts)架构,可能会降低后训练阶段的有效性和模型可对齐性。作者进一步追溯了 shared experts 的技术脉络,发现在前沿规模上其实并没有决定性证据表明它对预训练有益。对方还自嘲多 token 预测论文的「阴霾」:如今每次在小规模上得到平庸结果,都会想多跑几个消融说不定就魔法般有效。

所属事件:研究称共享专家架构或损害中文开源模型后训练对齐性(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →