Paradigm 训练栈大量借入 nanogpt speedrun 的架构创新
PMinervini · x · 2026-10-07
AI 实验室 Paradigm 透露其训练方案强烈借鉴并改造了 nanogpt speedrun 挑战中涌现的架构选择,具体包括:
- 用 NorMuon 训练矩阵形状的参数(Muon 的改进变体)
- 采用 MUDD 的变体做残差流混合
- 注意力层使用 XSA
转发者 tensorqt 感慨把时间线上看了几个月的技巧真正落地很 surreal,认为 speedrun 已成为架构创新的重要来源。这说明 Keller Jordan 等推动的 speedrun 社区成果正在被工业界训练项目实际采用。
所属事件:Paradigm 训练栈大量借鉴 nanogpt speedrun 架构创新(3 条相关)→
「研究」频道最新
- WildMatch:仅用个体标签弱监督适配关键点匹配器,野生动物重识别更准 — Turhan Can Kargin · 2026-10-07
- CTP 单次前向预测多模态动作块:LIBERO 成功率 97.25%,推理延迟降至 76ms — Di Wu · 2026-10-07
- EAPN 用执行对齐噪声解决重规划模式切换,双臂叠布成功率 96.7% — Di Wu · 2026-10-07
- 研究者把软件当人看?Gerard Sans 驳「模型知道自己被观察」论 — gerardsans · 2026-10-07
- 88B token小学课程训练:LittleLearner证明新能力是“诱发”而非“习得” — amplifiedamp · 2026-10-07
- 机器人仿真器 RaiSim 回归:2.8.0 主打 CPU 高速仿真+照片级渲染 — ChongZzZhang · 2026-10-07