Limite 1B 借鉴 nanogpt speedrun 架构,用 NorMuon 训练

tensorqt · x · 2026-10-07

Paradigma 团队介绍 Limite 1B 训练中的架构选型:大量借鉴了 nanogpt speedrun 挑战中涌现的设计,包括在矩阵形参数上使用 NorMuon 优化器、用 MUDD 变体做残差流混合、在注意力层引入 XSA。

这是 Limite 1B - Violetto 技术报告发布线程的一部分,完整信息见技术报告。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →