Cerebras 论文:层 dropout 省四分之一训练算力,推理提速 1.55 倍
burny_tech · x · 2026-09-09
Cerebras 团队论文《Don't Drop Dropout》推翻了「dropout 在大规模预训练中损害精度」的流行认知,证明配置得当的层 dropout 应该重回 SOTA 训练配方。
核心做法
- 以整个 Transformer block 为单位应用层 dropout(即随机深度),按序列采样
- 沿网络深度采用递增的丢弃分布
- 训练过程中丢弃率按递减日程衰减至零
主要结论
- 基于 2400 余次训练实验(模型 271M–8.2B 参数,数据最多 160B tokens),相同训练 FLOPs 下层 dropout 带来更低验证损失
- 相同步数下最高可省 25% 训练 FLOPs 而保持精度
- 训练后收益:模型具备「深度弹性」,支持 early exit、跳层推理和 self-speculative decoding,推理最高提速约 1.55 倍且精度损失可忽略
所有预训练实验在 Cerebras CS-3 系统上完成。
「Infra」频道最新
- GLM 5.3 Flash 上线 W&B serverless:1M 上下文带视觉,$0.5/百万输出 — wandb · 2026-09-09
- 播客热议 Broadcom 定制 ASIC 与 2027 供给瓶颈,兼谈 Nvidia 收购 Hugging Face — BenBajarin · 2026-09-09
- Magnitude 开源 Apple 芯片推理服务器:自动为 Mac 选型调优本地模型 — nickbaumann_ · 2026-09-09
- Viettel 三层开源栈统一 GPU 集群,打造 Token-as-a-Service 平台 — PyTorch · 2026-09-09
- 动作每回合都变?把工具 Schema 放最后一条消息保住缓存 — Low_Bad_6585 · 2026-09-09
- 开源项目 minnow:主打高速的 LLaDA2.2 推理服务器 — coder543 · 2026-09-09