爱好者把 Gemma4-12B 改造成 22.5B MoE 模型
Desperate-Sir-5088 · reddit · 2026-07-21
作者介绍了自己把 Gemma4-12B“改造”成 Solon-MoE 的实验:一个 22.5B 参数 的 MoE 模型,并不是从头训练出来,而是通过 upcycling 做出来的。
结构设计
- 48 层里只有中间 15 层被改成 MoE,且这段里还保留了两层 dense 层。
- 每个 MoE 层都保留原始 dense FFN 作为 shared expert,作为稳态兜底。
- 额外加入 4 个 expert,但每个 token 只走 top-2,并把输出乘上较小的系数。
专家怎么来的
- 不是随机加噪复制,而是对原 FFN 的 SVD 谱做不同频段的轻微放大。
- 这样可以打破 expert 对称性,同时保留大部分原始权重。
- 作者称保留了 92% 以上 的原始权重。
Router 怎么初始化
- 路由器权重来自法律、STEM 和韩语通用文本的激活聚类中心。
- 先去掉共享主方向,再让路由器从一开始就带有领域感知。
作者也明确说,这只是一个带大量 AI 辅助的个人 hobby 项目,大概率不会整体超过原始 base model,但可能在少数领域有用。
「模型」频道最新
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- ChatGPT 竟劝用户「问题太复杂,去试试更笨的回答」 — phido3000 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11
- Opus 以"安全"为由拒碰蛋白质生成代码,开发者吐槽误伤 — josephdviviano · 2026-09-11