把数据集打包成顺序 blob,训练吞吐提升 30%
irinarish · x · 2026-07-21
- 作者把一个 ML 训练流水线的吞吐从 **36 steps/min 提升到 47 steps/min**,核心办法是改造数据在磁盘上的存储方式。 - 在消费级硬件上,瓶颈常常不是算力而是存储:**NVMe 太贵**,**SATA HDD 很慢**,尤其当数据集由大量小文件组成时更明显。 - 他的做法是把数据预先打包成连续存储的压缩 blob,例如 **TAR / Parquet / WebDataset**,让硬盘尽量做顺序读,减少随机寻道。 - 如果文件本身已经压缩过,就可以考虑**不再二次压缩**,避免额外的压缩/解压开销;文中举了 **FLAC** 的例子。 - 还提到超大规模训练通常不能把数据放在本地盘上,而是依赖与 GPU 同机房的**网络存储块**。
「Infra」频道最新
- 台积电被曝拟在 2027 年上调芯片代工价格最高 10% — kimmonismus · 2026-07-21
- Ramp 称模型路由器可把 LLM 成本降 30% — rohanpaul_ai · 2026-07-21
- Merve Noyan:更多开源模型和 llama.cpp 更新在路上 — mervenoyann · 2026-07-21
- 加第二家 LLM provider,坏的往往不只是接口 — Ok_Extension6373 · 2026-07-21
- 英国 AI 数据中心因热量、噪音和占地遭到反弹 — nordicinst · 2026-07-21
- Fluidstack 融资 8.3 亿美元,估值 75 亿美元并承接 Anthropic 500 亿美元算力项目 — rohanpaul_ai · 2026-07-21