从零后训练 Yandex 80B 模型踩坑:自写 v100 内核 NaN 毁掉一轮训练
jjusko20 · reddit · 2026-10-03
作者更新了从头对 Yandex 的 AliceAI-80B-A3B(instruct 版)做 post-training 的进展:
- 上一轮训练翻车:评估 QLoRA 时发现除两层外所有层梯度为零,定位到是自写 V100 kernel 引入的 NaN 问题——此前 loss 曲线只靠两层在训练,居然也能拟合出一个看似合理的走势,直到真正评估才暴露。
- 作者已修复并重启训练,再次通过 Cloudflare 隧道公开直播训练过程,新 loss 曲线明显更健康。
- 帖中附了两轮训练首个 epoch 的 loss 曲线对比图。
「模型」频道最新
- 128GB Mac Studio M5 Max 实测:Gemma 4 26B 134 tok/s 全对 — TheOyinbooke · 2026-10-03
- Keras 社区电话会:将新增 MLX 与 PaddlePaddle 插拔式后端 — fchollet · 2026-10-03
- Clef 修复视觉输入延迟 bug,图像响应尾部延迟大幅改善 — michellechen · 2026-10-03
- 开源项目 clef 冲上 Hugging Face 趋势榜第三 — michellechen · 2026-10-03
- Arena 周报:Gemini 4 Argon 登顶文本榜,Sonnet 5.5 以 20% 价格逼近 GPT-6 — arena · 2026-10-03
- DeepSeek 开源内核揭密华为昇腾 950:32 AI 核与降功耗提频设计 — teortaxesTex · 2026-10-03