2400 次实验验证:层级 dropout 可在 LLM 预训练中匹配稠密基线
burkov · x · 2026-09-10
一项系统研究重新审视了被现代预训练配方抛弃的 layer dropout 技术——随机跳过整个 transformer 块训练,历史上可加速训练并支持变深推理,但因大规模下精度损失报告而弃用。
- 研究者在 Cerebras CS-3 上做了超过 2400 次受控实验
- 模型规模从 2.71 亿到 82 亿参数,数据集最高 1600 亿 token
- 目标是联合优化配置,验证 layer dropout 能否在匹配甚至超过稠密基线的同时,降低训练 FLOPs 和推理延迟
结论意义在于:如果能达到稠密基线的质量,该技术可为大模型训练带来可观的算力节省与推理灵活性。
所属事件:Cerebras论文:层级dropout可省四分之一训练算力(2 条相关)→
「Infra」频道最新
- Keras 推出 ZeroModels:100+ 模型族纯 Keras 3 跨后端运行 — fchollet · 2026-09-10
- Cohere 迁移 Blackwell,多项负载 token 成本与延迟降 30–50% — cohere · 2026-09-10
- 作者用本地 AI 模型免费审校书稿,连无聊段落都揪出来 — walkingriver · 2026-09-10
- 分析:华为将推更便宜、专为国产模型调优的 AI 芯片 — 2C_ornot2C · 2026-09-10
- Photon 2.2 发布:优化 Ampere 到 Blackwell 全系 GPU 本地推理 — JFPuget · 2026-09-10
- 算完账:用前沿 AI API 标注一场足球赛要花 5000 多美元 — bittingthembits · 2026-09-10