Cerebras论文:层级dropout可省四分之一训练算力

Cerebras 团队论文《Don't Drop Dropout》推翻了「dropout 在大规模预训练中损害精度」的流行认知。基于约2400次实验的系统研究表明,配置得当的层 dropout(随机跳过整个 transformer 块训练)可在LLM预训练中匹配稠密基线精度,同时节省约四分之一训练算力,并将推理提速1.55倍,主张该技术应重回SOTA预训练配方。

2026-09-09 ~ 2026-09-10 · 2 条相关