Shared Experts May Hurt Post-Training Alignment in Chinese Open Models
A researcher proposes that shared experts, a common architecture in Chinese open-source models, may reduce post-training effectiveness and alignability, with tracing analysis finding no evidence of scaling benefits.
2026-10-07 ~ 2026-10-07 · 2 related posts
- Shared Experts in MoE Lack Frontier-Scale Evidence and May Hurt Post-Training, Researchers Argue — menhguin · 2026-10-07
- Researcher: shared experts in Chinese open-source models may hurt post-training alignability — menhguin · 2026-10-07