借鉴 nanogpt speedrun 架构,探索样本效率与训练速度的平衡点
tensorqt · x · 2026-10-07
Paradigm 团队针对高质量数据稀缺带来的样本效率问题展开研究:样本效率提升往往意味着更长的训练时间,他们尝试找到兼顾速度与效率的折中方案。具体做法上,团队大量借鉴并改造了 nanogpt speedrun 挑战中涌现的架构选择:在矩阵形参数上使用 NorMuon 优化器(Muon 的变体),残差流混合采用 MUDD 变体,注意力层引入 XSA。这是一条训练方法层面的实证探索,对预训练效率优化有参考价值。
所属事件:Paradigm 训练栈大量借鉴 nanogpt speedrun 架构创新(3 条相关)→
「研究」频道最新
- QUEEN 论文:把 AlphaZero 式搜索翻译成语言再蒸馏给大模型下棋 — danqi_chen · 2026-10-07
- VLM能否内化工具调用?「用图像思考」研究登陆COLM — PMinervini · 2026-10-07
- CLeaR 2027 会议投稿通道正式开放 — ArthurGretton · 2026-10-07
- MIT 论文:极简 agent 循环靠「历史即变量」胜过专用记忆系统 — rohanpaul_ai · 2026-10-07
- doodlestein 发布讲解视频,并开源配套代码仓库 — doodlestein · 2026-10-07
- 全 Rust 端到端生成 7 分钟 3Blue1Brown 风格讲解视频 — doodlestein · 2026-10-07