2400 次实验验证:层级 dropout 可在 LLM 预训练中匹配稠密基线

burkov · x · 2026-09-10

一项系统研究重新审视了被现代预训练配方抛弃的 layer dropout 技术——随机跳过整个 transformer 块训练,历史上可加速训练并支持变深推理,但因大规模下精度损失报告而弃用。

结论意义在于:如果能达到稠密基线的质量,该技术可为大模型训练带来可观的算力节省与推理灵活性。

所属事件:Cerebras论文:层级dropout可省四分之一训练算力(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →