Hugging Face Datasets 5.1.0 发布:修复多 worker 流式数据集多处问题
lmoroney · x · 2026-10-06
Hugging Face Datasets 5.1.0 发布,重点修复流式 (iterable) 数据集的痛点:
- DataLoader worker 数量超过 shard 数时,take/skip 计数现在保持正确
- 对流式子集 skip/take 后可正常完成 epoch 迭代
- shuffle 不再打乱源 shard 顺序;分布式 IterableDataset 中 skip 会正确切分数据源
- splitdatasetbynode 新增 strategy 参数
格式方面新增 Vortex 高性能列式格式,以及面向 DNA 序列、蛋白质链和 3D 分子结构的 FASTA、FASTQ、GenBank、PDB、mmCIF。作者建议用多 worker 流式训练的用户升级,并用单 epoch 计数器验证各 worker 样本数之和是否正确。
所属事件:Hugging Face Datasets 5.1 发布:新增 Vortex 与生物分子格式(3 条相关)→
「Infra」频道最新
- Mistral Large 4 仅用 4000 块 GPU 训练,竞品 Astra 用了 10 万块 — steipete · 2026-10-07
- SpaceX 曝百万卫星 Starlink 算力架构:10 星成组、组内 10T 带宽 — XFreeze · 2026-10-07
- AI 找到的安全漏洞激增,OpenSSH 改为更频繁发版 — jedisct1 · 2026-10-07
- Lambda 推出 AIPerf:衡量模型在真实用户负载下的表现 — TheZachMueller · 2026-10-07
- 谷歌发布 EmbeddingGemma 2:740M 参数开源多模态嵌入模型 — sundarpichai · 2026-10-07
- GPU 五到九成时间在等内存,巨头押注重建整个 AI 基础设施 — alex_verem · 2026-10-07