GPU 利用率 15% 到 90%:多模态训练瓶颈在数据管线

AI Engineer · youtube · 2026-10-10

Amazon AGI 工程师 Tarun Sunkaraneni 在 AI Engineer World's Fair 的演讲指出:多模态训练往往是 CPU/IO 受限而非 GPU 受限。在 S3 图像上训练 Qwen3-VL 式模型时,基线管线约 85% 时间在等数据,GPU 利用率仅 15%。

他逐个修复瓶颈:用 asyncio + Ray actors 做并发、预取让数据先于 trainer 请求就绪、用 Ray object store 实现大张量跨进程零拷贝;到生产规模后又遇到单机网卡瓶颈,通过跨节点分散 worker 和零拷贝读取再获 50% 吞吐提升,最终等待时间从 85% 降到 20%。还讨论了 asyncio/线程/进程围绕 GIL 的取舍,以及某些优化只在规模上去后才划算。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →