训练时跳过故障阶段:1% 故障率下损失几乎不掉
covenant_ai · reddit · 2026-09-22
Templar 团队在其分布式预训练平台 Crucible 上研究容错:结合数据并行副本与流水线并行,用 SparseLoCo 在副本间交换压缩更新、流水线压缩降低阶段间通信。核心创新是 stage skipping——当某个中间阶段宕机时,激活和梯度在多个 step 内绕过该阶段,健康阶段继续处理 token 而非等待恢复。
仿真设置:178M 模型、8 个副本、每副本 4 个阶段;每全局 step 副本故障率 1%,每次故障让一个阶段缺席 6 个全局 step。结果显示验证损失仍接近无故障基线。此外,跨层共享的固定投影(projector)在使用流水线压缩时进一步提升鲁棒性,作者假设是共享投影让各阶段边界的表示对齐,从而减少绕过的破坏性(仍为假说)。
作者指出这为在不可靠机器和竞价实例等更大算力池上训练指了方向;但注意这是对阶段失效学习效应的仿真,并非物理换机或生产成本的实测。
「Infra」频道最新
- 421M 参数 Laya 模型经 OpenVINO INT8 量化后纯 CPU 玩 Flappy Bird — simpleuserhere · 2026-09-23
- 16GB 显存跑 Qwen3.8-27B 上 160k 上下文,全套配置公开 — According_Study_162 · 2026-09-23
- MLX-Serve 发布 v26.95:Qwen-Image 2.1 上 Mac,四路并发提速近一倍 — TheMoonMidas · 2026-09-23
- DigitalOcean Managed Agents 公测:闲置即暂停,接 75+ 模型 — HeyAmit_ · 2026-09-23
- 换掉最终决策层:Qwen+SGLang 比 Jev 快 37% 且精度相当 — VeryWellVersed · 2026-09-23
- Reka EdgeQ 端侧 VLM 登陆骁龙 8 Elite,首 token 仅 0.73 秒 — RekaAILabs · 2026-09-23