研究者称共享专家或降低中国开源模型后训练对齐效果
menhguin · x · 2026-10-07
一位做可解释性研究的作者在讨论中透露,他们在 interp 预训练提案中探索的一个理论是:中文开源模型中常见的共享专家(shared experts)架构,可能会降低后训练阶段的有效性和模型可对齐性。作者进一步追溯了 shared experts 的技术脉络,发现在前沿规模上其实并没有决定性证据表明它对预训练有益。对方还自嘲多 token 预测论文的「阴霾」:如今每次在小规模上得到平庸结果,都会想多跑几个消融说不定就魔法般有效。
所属事件:研究称共享专家架构或损害中文开源模型后训练对齐性(2 条相关)→
「模型」频道最新
- 新 Mistral API 可用但权重未开,遭质疑不该上开源榜 — CharlotteHase · 2026-10-07
- AI 用量在能力过阈值后指数级爆发,数学或是下一个拐点 — menhguin · 2026-10-07
- you.com 搜索进 RL 循环训练 Nemotron,BrowseComp 升至 45.45% — PolarBearby · 2026-10-07
- 学生党实测:学习场景下 Gemini 全面压制 ChatGPT — CommonExplanation711 · 2026-10-07
- OpenAI 发布 722 篇数学论文,平均 3 小时算力攻多个百年难题 — Latent Space · 2026-10-07
- 「AI 永远写不好写作」防线的坚守者:这条战线撑得最久 — wordgrammer · 2026-10-07