爱好者把 Gemma4-12B 改造成 22.5B MoE 模型
Desperate-Sir-5088 · reddit · 2026-07-21
作者介绍了自己把 Gemma4-12B“改造”成 Solon-MoE 的实验:一个 22.5B 参数 的 MoE 模型,并不是从头训练出来,而是通过 upcycling 做出来的。
结构设计
- 48 层里只有中间 15 层被改成 MoE,且这段里还保留了两层 dense 层。
- 每个 MoE 层都保留原始 dense FFN 作为 shared expert,作为稳态兜底。
- 额外加入 4 个 expert,但每个 token 只走 top-2,并把输出乘上较小的系数。
专家怎么来的
- 不是随机加噪复制,而是对原 FFN 的 SVD 谱做不同频段的轻微放大。
- 这样可以打破 expert 对称性,同时保留大部分原始权重。
- 作者称保留了 92% 以上 的原始权重。
Router 怎么初始化
- 路由器权重来自法律、STEM 和韩语通用文本的激活聚类中心。
- 先去掉共享主方向,再让路由器从一开始就带有领域感知。
作者也明确说,这只是一个带大量 AI 辅助的个人 hobby 项目,大概率不会整体超过原始 base model,但可能在少数领域有用。
「模型」频道最新
- 有人称 Kimi 短期走势取决于 K3 基座模型发布 — _xjdr · 2026-07-27
- Kimi K3 在网络安全上很强,但 token 效率卡住了评测 — teortaxesTex · 2026-07-27
- 欧洲 ChatGPT Plus 用户开始看到“Extra High”质量选项 — PressPlayPlease7 · 2026-07-27
- Opus 5 传在赛车游戏测试中一次过关 — soumitrashukla9 · 2026-07-27
- Claude Opus 5 据称价格减半并刷榜 Frontier-Bench — GregCook2011 · 2026-07-27
- 研究者称防御场景更偏向开放模型,Kimi K3 已接近高水平网络安全能力 — eliebakouch · 2026-07-27