借鉴 nanogpt speedrun 架构,探索样本效率与训练速度的平衡点

tensorqt · x · 2026-10-07

Paradigm 团队针对高质量数据稀缺带来的样本效率问题展开研究:样本效率提升往往意味着更长的训练时间,他们尝试找到兼顾速度与效率的折中方案。具体做法上,团队大量借鉴并改造了 nanogpt speedrun 挑战中涌现的架构选择:在矩阵形参数上使用 NorMuon 优化器(Muon 的变体),残差流混合采用 MUDD 变体,注意力层引入 XSA。这是一条训练方法层面的实证探索,对预训练效率优化有参考价值。

所属事件:Paradigm 训练栈大量借鉴 nanogpt speedrun 架构创新(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →