Cerebras:别丢掉 Dropout,层稀疏化让 LLM 训练推理双提速
cerebras · hf · 2026-09-07
Cerebras 发布研究,主张在大模型训练中不要放弃 Dropout——优化层级稀疏性(layer dropout)可以提升训练效率,并带来推理收益。
方法上通过在训练中随机跳过部分层进行优化,训好的模型支持 early exit(简单输入提前出结果)和投机解码加速,在不损失准确率的前提下加快推理。这是一个把训练正则化技巧转化为推理加速手段的思路。
「Infra」频道最新
- 10万 GPU 而非 NVL72 整机架:超大集群规模传闻被纠偏 — firstadopter · 2026-09-07
- Astra 算力效率几何?业界推算前沿模型训练成本差距可达十倍 — teortaxesTex · 2026-09-07
- 白嫖 20 小时:Kaggle 免费跑 Qwen3 27B 供 Agent 调用 — TheMoonMidas · 2026-09-07
- llama.cpp 跑 Qwen3.6-35B MTP 投机解码,求 draft 接受率调优 — Bulky-Priority6824 · 2026-09-07
- Google 发布 MaxKernel:多智能体系统自动写 TPU kernel 达专家级 — google · 2026-09-07
- 量化毁掉 RNN 记忆?误差反馈可免训练恢复 GRU/LSTM 精度 — Ismail Erbas · 2026-09-07