把数据集打包成顺序 blob,训练吞吐提升 30%

irinarish · x · 2026-07-21

- 作者把一个 ML 训练流水线的吞吐从 **36 steps/min 提升到 47 steps/min**,核心办法是改造数据在磁盘上的存储方式。 - 在消费级硬件上,瓶颈常常不是算力而是存储:**NVMe 太贵**,**SATA HDD 很慢**,尤其当数据集由大量小文件组成时更明显。 - 他的做法是把数据预先打包成连续存储的压缩 blob,例如 **TAR / Parquet / WebDataset**,让硬盘尽量做顺序读,减少随机寻道。 - 如果文件本身已经压缩过,就可以考虑**不再二次压缩**,避免额外的压缩/解压开销;文中举了 **FLAC** 的例子。 - 还提到超大规模训练通常不能把数据放在本地盘上,而是依赖与 GPU 同机房的**网络存储块**。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →