BigMac 用嵌套流水线提速多模态训练最高 1.9 倍
机器之心 · wechat · 2026-07-24
BigMac 用嵌套流水线打破多模态训练的算力-显存两难
机器之心介绍了原生多模场景下的流水并行训练新范式 BigMac。它把成熟的 LLM 流水线作为主干,在不打乱原有执行顺序的前提下,将编码器和生成器计算依赖安全地嵌入进去,尽量同时保住吞吐和显存。
- 传统多模态训练通常只能二选一:要么把模态模块从 LLM 流水中拆开,减少 bubble 但堆高 activation 显存;要么把所有模块塞进同一条 pipeline,显存更省却容易因为跨模块等待产生停顿。
- BigMac 的核心是 nested pipeline:先稳定 LLM 的 1F1B / interleaved 1F1B 调度,再把 encoder / generator 放进“不会打乱 LLM 顺序”的位置,从而让模态激活更早释放。
- 系统层面还提供了全局调度表、对算法工程师透明的接口,以及 profiler / simulator / 可视化工具,方便定位 bubble、通信等待和模块交接瓶颈。
- 在两个代表性负载上,论文报告训练速度相对基线提升 1.08~1.9 倍,并且在 global batch size 增大时保持稳定显存占用。
所属事件:BigMac 嵌套流水线突破多模态训练瓶颈(2 条相关)→
「Infra」频道最新
- MiniMax 称 AMD MI355X 在模型 serving 上已接近 B200 — hongyangzh · 2026-07-24
- Alphabet 营收增 24%至 1198 亿美元,云业务增 82% — minsuk_chang · 2026-07-24
- Taylor Lorenz:AI 数据中心反弹已失去分寸 — AndyMasley · 2026-07-24
- Vercel 通过构建期预编译,让 Python functions 启动快 2 倍 — cramforce · 2026-07-24
- Google 新增算力不只供云业务,还在喂养搜索和广告 — aronchick · 2026-07-24
- 先进封装才是 AI 芯片供给的关键瓶颈 — Beth_Kindig · 2026-07-24