Cerebras论文:层级dropout可省四分之一训练算力
Cerebras 团队论文《Don't Drop Dropout》推翻了「dropout 在大规模预训练中损害精度」的流行认知。基于约2400次实验的系统研究表明,配置得当的层 dropout(随机跳过整个 transformer 块训练)可在LLM预训练中匹配稠密基线精度,同时节省约四分之一训练算力,并将推理提速1.55倍,主张该技术应重回SOTA预训练配方。
2026-09-09 ~ 2026-09-10 · 2 条相关
- Cerebras 论文:层 dropout 省四分之一训练算力,推理提速 1.55 倍 — burny_tech · 2026-09-09
- 2400 次实验验证:层级 dropout 可在 LLM 预训练中匹配稠密基线 — burkov · 2026-09-10