capi 作者点破训练提速技巧:按批次比例丢 token 替代逐样本 dropout
giffmana · x · 2026-09-09
- Tim Darcet 提出改进 token drop 的做法:把「每个样本以概率 p 被丢弃」改为「每个 batch 丢弃固定比例 p」,这样各样本形状恒定、效率更好,且全部在 GPU 上时能完美通过编译。
- giffmana 回应指出这与 tokendrop 中的 permute+slice 是同一招,但也提醒:固定比例丢 batch 只适用于样本尺寸固定的场景,如今视觉和语言模型中可完整看到某层或不看的动态尺寸情形已基本不适用。并提到这来自 capi 项目。
所属事件:Meta 研究员分享按批次比例丢弃样本的训练提速技巧(3 条相关)→
「Infra」频道最新
- 同等预算怎么选:MacBook Air 搭 48GB 显存台机 vs MacBook Pro 64GB — gappyvalley · 2026-09-09
- NVIDIA 官宣 CUDA Rust:用 Rust 写 GPU 内核的两条路线 — ducha_aiki · 2026-09-09
- OpenAI 与三星联合研发生产下一代 AI 芯片 — rohanpaul_ai · 2026-09-09
- Hetzner VPS 两年账单涨 543%,用户晒 €5.3 到 €34 涨价单 — ThePeterMick · 2026-09-09
- Harbor OSS 周处理 80T tokens,已超 OpenRouter 的 70T — simonguozirui · 2026-09-09
- Supabase 开源 Multigres:兼容 Postgres 可扩展至 PB 级 — dshukertjr · 2026-09-09