Meta 论文:推荐系统训练中仅 50-60% 时间真正在训练
_reachsumit · x · 2026-10-02
Meta 团队在 arXiv 发布论文,研究其最大规模推荐系统训练集群(数千 GPU、日处理数百亿样本)的效率问题。论文指出,此前这些训练任务只有 50-60% 的端到端时间在真正训练新数据,其余被「生命周期开销」悄然吞噬。
核心贡献:
- 提出 Effective Training Time (ETT%) 指标,用于量化训练集群中损失的时间,并定位到可独立归属的基础设施组件
- 揭示跨任务重启被重复执行的工作
配套优化覆盖整个训练栈:trainer 初始化阶段的通信消除与流水线重叠、动态 shape 处理与自动调优剪枝、可复用的 PyTorch 2 编译缓存、异步 checkpointing、独立模型发布流程以及恢复成本削减。论文在代表性模型上评估了各优化项,并在实际训练集群中验证 ETT% 全面提升。
「Infra」频道最新
- 700 个工具的 awesome-jev 清单:专管生产环境的「决策模型」生态 — Remarkable-Gur719 · 2026-10-02
- smolvm v1.22 发布:agent 动作可撤销,快照恢复近瞬时 — LoganGrasby · 2026-10-02
- 传 Broadcom 拟向 Anthropic 提供至多 420 亿美元贷款买芯片 — rohanpaul_ai · 2026-10-02
- 开发者开源 GPT-2 XL 本地复现项目,CPU 即可跑 15 亿参数老模型 — MikePFrank · 2026-10-02
- CoreWeave 推出 serverless GPU:按小时付费、无需合约,私测开放 — altryne · 2026-10-02
- 日本拟投 1400 亿美元建 AI 数据中心,华为 Mate90 全系搭韬芯片 — 创业邦 · 2026-10-02