Meta researcher shares batch-ratio token dropping training trick

Meta researcher TimDarcet shared a training optimization: drop tokens by batch ratio instead of per-sample probability, keeping tensor shapes fixed and improving GPU efficiency, sparking discussion on applying similar pruning to full-layer computation.

2026-09-09 ~ 2026-09-09 · 3 related posts