Paradigm 训练栈大量借鉴 nanogpt speedrun 架构创新
Paradigm 团队公开其训练方案大量借鉴并改造了 nanogpt speedrun 挑战中涌现的架构创新,包括在矩阵形参数上使用 NorMuon 优化器等设计。团队称 Limite 1B 模型的训练即采用这些选型,研究动机在于高质量数据稀缺带来的样本效率问题:提升样本效率往往导致训练时间变长,他们试图在样本效率与训练速度之间找到兼顾的折中方案。
2026-10-07 ~ 2026-10-07 · 3 条相关
- Limite 1B 借鉴 nanogpt speedrun 架构,用 NorMuon 训练 — tensorqt · 2026-10-07
- 借鉴 nanogpt speedrun 架构,探索样本效率与训练速度的平衡点 — tensorqt · 2026-10-07
- Paradigm 训练栈大量借入 nanogpt speedrun 的架构创新 — PMinervini · 2026-10-07