BigMac 用嵌套流水线提速多模态训练最高 1.9 倍
机器之心 · wechat · 2026-07-24
BigMac 用嵌套流水线打破多模态训练的算力-显存两难
机器之心介绍了原生多模场景下的流水并行训练新范式 BigMac。它把成熟的 LLM 流水线作为主干,在不打乱原有执行顺序的前提下,将编码器和生成器计算依赖安全地嵌入进去,尽量同时保住吞吐和显存。
- 传统多模态训练通常只能二选一:要么把模态模块从 LLM 流水中拆开,减少 bubble 但堆高 activation 显存;要么把所有模块塞进同一条 pipeline,显存更省却容易因为跨模块等待产生停顿。
- BigMac 的核心是 nested pipeline:先稳定 LLM 的 1F1B / interleaved 1F1B 调度,再把 encoder / generator 放进“不会打乱 LLM 顺序”的位置,从而让模态激活更早释放。
- 系统层面还提供了全局调度表、对算法工程师透明的接口,以及 profiler / simulator / 可视化工具,方便定位 bubble、通信等待和模块交接瓶颈。
- 在两个代表性负载上,论文报告训练速度相对基线提升 1.08~1.9 倍,并且在 global batch size 增大时保持稳定显存占用。
所属事件:BigMac 嵌套流水线突破多模态训练瓶颈(2 条相关)→
「Infra」频道最新
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11
- 本地跑 LLM 选卡:4 张 CMP-170HX 涨价 vs Mac Studio M5 — rumboll · 2026-09-11
- llama.cpp 为 RDNA4 调优 Flash Attention,大上下文提升明显 — pmttyji · 2026-09-11