Hugging Face 发布 The Stack v3:114TB 史上最大开源代码数据集
Hugging Face 团队正式发布 The Stack v3 代码数据集,将其定位为下一代开源代码模型及网络防御场景的训练底座。该数据集是目前最大的开源代码数据集,为社区提供了海量且经过清洗的高质量训练资源。
已确认
数据集原始数据总量达 114TB,提取自 2240 万个代码仓库,语料覆盖了 770 多种编程语言。经过严格的去重和过滤后,最终包含约 5 万亿(5T)个可直接用于训练的源码 token,处理后数据体量约为 15.9 TB。此外,团队在制作过程中重做了去重流程,并修复了此前存在的去重 bug。据作者 @soldni 与 @giffmana 补充,旧版本管道中的 MinHash 分词器存在隐蔽缺陷(误用 \W 而非 \W+),导致 C++ 等代码特征中充斥空字符串,使得几乎所有高级语言都共享了相同的无效特征,该问题在 v3 中得到解决。
为什么重要
在当前 AI 发展阶段,强大的开源模型对社区至关重要。The Stack v3 为开发者提供了一个极其庞大的高质量代码训练基础,将直接推动开源代码模型及相关网络安全工具的研发进程。
2026-07-23 ~ 2026-07-24 · 13 条相关
一手来源
- The Stack v3 上线:5T 训练 tokens 和 120TB 数据 — lvwerra ·
- The Stack v3 发布:114TB 开源代码数据集、约 5T token — soldni ·
- The Stack v3 发布:114TB、2240 万仓库并修复去重 bug — anton_lozhkov ·
- 【源头】The Stack v3 发布:114TB、2240 万仓库并修复去重 bug — anton_lozhkov · 2026-07-23
- The Stack v3 发布 5 万亿代码 token、覆盖 700 多种语言 — LoubnaBenAllal1 · 2026-07-23
- 【源头】The Stack v3 上线:5T 训练 tokens 和 120TB 数据 — lvwerra · 2026-07-23
- Hugging Face 发布 The Stack v3:5 万亿 token 开源代码数据集 — lvwerra · 2026-07-23
- Hugging Face 数据集 stack-v3-train 走热,主打多语言代码数据 — HuggingFaceCode · 2026-07-24
- MinHash 去重踩坑:开发者探讨用 LLM 审查隐蔽的代码 Bug — giffmana · 2026-07-24
- Hugging Face 发布 114TB 开源代码数据集 The Stack v3 — Nunki08 · 2026-07-24
另有 6 条近重复转述:lvwerra · MeganRisdal · anton_lozhkov · soldni · JJitsev · anton_lozhkov