新优化器 Tauon 小规模测试超越 Muon:损失更低、每步快约 8.5%
kkkrlklo · reddit · 2026-09-27
作者发布新优化器 Tauon,与 Muon 同属多项式+正交化思路,但做了两点改进:
- 通过谱滤波把迭代步数从 Muon 的 5 步降到 3 步,再经系数调度降到 2 步
- 用 DCT-2 变换缩小矩阵尺寸
在 TinyShakespeare 上训练 GPT-Mini(dmodel=512, 6 层)对比:
- 验证损失:Tauon 收敛到约 1.6,优于 Muon(约 1.65)和 AdamW(约 1.8)
- 稳定性:AdamW 在约 1200 步后开始过拟合/发散,Tauon 全程 3000 步稳定
- 计算成本:Tauon 391.5 ms/step,比 Muon 的 427.7 ms/step 快约 8.5%,接近 AdamW 的 382.9 ms/step
作者坦承这只是 Kaggle 免费 T4 上 2 小时跑出的极小规模基准,代码已开源并上传 PyPI(pip install tauon-optimizer),希望有人在更大规模上复测。
「研究」频道最新
- Rethink Priorities 发布数字意识模型:2024 LLM 无意识证据不决定性 — burny_tech · 2026-09-27
- 小米开源 RL 环境仓库,单任务市价数百至上千美元 — burny_tech · 2026-09-27
- 从噪声高维观测恢复系统方程,DYSCO 论文入选 NeurIPS — burny_tech · 2026-09-27
- Solomonoff 归纳像智能的真实运作,但物理上无法实现 — burny_tech · 2026-09-27
- 小米开源 7000+ 个训练 MiMo 的强化学习任务环境 — burny_tech · 2026-09-27
- 没有 Lean,AI 数学能力会弱多少?验证器地位引思考 — burny_tech · 2026-09-27