Meta 研究员分享按批次比例丢弃样本的训练提速技巧
Meta 研究员 TimDarcet 分享了一个训练工程技巧:处理变长样本丢弃时,不要采用「每个样本以概率 p 被丢弃」的方式,而应改为「每个批次按固定比例 p 丢弃一部分」,这样各样本张量形状恒定,GPU 效率更好,且全部在设备端完成。另有研究者 giffmana 讨论将类似 permute+slice 的 token 剪枝技巧用于完整层计算在变长输入下是否可行。
2026-09-09 ~ 2026-09-09 · 3 条相关
- Meta 研究员分享 capi 训练技巧:按批次比例丢弃样本保住 GPU 效率 — TimDarcet · 2026-09-09
- capi 作者点破训练提速技巧:按批次比例丢 token 替代逐样本 dropout — giffmana · 2026-09-09
- 研究者讨论 token 剪枝技巧在变长序列下的工程难题 — TimDarcet · 2026-09-09