Token 叠加训练:10B MoE 模型省 2.5 倍算力达同等损失

gordic_aleksa · x · 2026-09-19

Aleksa Gordić 解读 Nous Research 的预训练新思路「token superposition training (TST)」:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →