训练时跳过故障阶段:1% 故障率下损失几乎不掉

covenant_ai · reddit · 2026-09-22

Templar 团队在其分布式预训练平台 Crucible 上研究容错:结合数据并行副本与流水线并行,用 SparseLoCo 在副本间交换压缩更新、流水线压缩降低阶段间通信。核心创新是 stage skipping——当某个中间阶段宕机时,激活和梯度在多个 step 内绕过该阶段,健康阶段继续处理 token 而非等待恢复。

仿真设置:178M 模型、8 个副本、每副本 4 个阶段;每全局 step 副本故障率 1%,每次故障让一个阶段缺席 6 个全局 step。结果显示验证损失仍接近无故障基线。此外,跨层共享的固定投影(projector)在使用流水线压缩时进一步提升鲁棒性,作者假设是共享投影让各阶段边界的表示对齐,从而减少绕过的破坏性(仍为假说)。

作者指出这为在不可靠机器和竞价实例等更大算力池上训练指了方向;但注意这是对阶段失效学习效应的仿真,并非物理换机或生产成本的实测。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →