GPU 利用率 15% 到 90%:多模态训练瓶颈在数据管线
AI Engineer · youtube · 2026-10-10
Amazon AGI 工程师 Tarun Sunkaraneni 在 AI Engineer World's Fair 的演讲指出:多模态训练往往是 CPU/IO 受限而非 GPU 受限。在 S3 图像上训练 Qwen3-VL 式模型时,基线管线约 85% 时间在等数据,GPU 利用率仅 15%。
他逐个修复瓶颈:用 asyncio + Ray actors 做并发、预取让数据先于 trainer 请求就绪、用 Ray object store 实现大张量跨进程零拷贝;到生产规模后又遇到单机网卡瓶颈,通过跨节点分散 worker 和零拷贝读取再获 50% 吞吐提升,最终等待时间从 85% 降到 20%。还讨论了 asyncio/线程/进程围绕 GIL 的取舍,以及某些优化只在规模上去后才划算。
「Infra」频道最新
- 全球供应链的单城垄断:义乌圣诞装饰占 80%,ASML 垄断所有 EUV 光刻机 — sahilypatel · 2026-10-11
- 七大巨头签署电费保护承诺:AI 数据中心自担电网成本 — ChrisGPT · 2026-10-11
- 一座小镇垄断全球产业:义乌圣诞饰品 80%,EUV 光刻机全出 Veldhoven — sahilypatel · 2026-10-11
- SemiAnalysis 拆解 Anthropic 算力四方交易:350MW Rubin 约每 GPU 时 5.8 美元 — AccBalanced · 2026-10-11
- 本地 LLM 玩家的算力焦虑:2×3090 该不该升级 6 卡工作站 — infectiousstupidity · 2026-10-11
- RTX 5060 经非官方驱动在 macOS 15 上跑通 Metal 3 加速 — chemist_slime · 2026-10-11