Limite 1B 借鉴 nanogpt speedrun 架构,用 NorMuon 训练
tensorqt · x · 2026-10-07
Paradigma 团队介绍 Limite 1B 训练中的架构选型:大量借鉴了 nanogpt speedrun 挑战中涌现的设计,包括在矩阵形参数上使用 NorMuon 优化器、用 MUDD 变体做残差流混合、在注意力层引入 XSA。
这是 Limite 1B - Violetto 技术报告发布线程的一部分,完整信息见技术报告。
「模型」频道最新
- RedNote 被指拥有低调但实力雄厚的 AI 实验室 — teortaxesTex · 2026-10-07
- OpenAI 简化 API 限流门槛:五档并三档,500 美元即达最高级 — OpenAIDevs · 2026-10-07
- 用户吐槽 GPT-6.1 Sol 变慢变差:OpenAI 在 sandbagging? — rickasaurus · 2026-10-07
- 动态基准 SciConBench:AI 合成医学结论 61–90% 含事实错误 — manoelribeiro · 2026-10-07
- Cohere Labs 发布 Tiny Aya:覆盖 70+ 语言的小型多语言模型家族 — Cohere_Labs · 2026-10-07
- Paradigm 发布 1B 数学模型 Violetto,技术报告出炉 — tensorqt · 2026-10-07