Hugging Face 发布 The Stack v3:114TB 史上最大开源代码数据集

Hugging Face 团队正式发布 The Stack v3 代码数据集,将其定位为下一代开源代码模型及网络防御场景的训练底座。该数据集是目前最大的开源代码数据集,为社区提供了海量且经过清洗的高质量训练资源。

已确认

数据集原始数据总量达 114TB,提取自 2240 万个代码仓库,语料覆盖了 770 多种编程语言。经过严格的去重和过滤后,最终包含约 5 万亿(5T)个可直接用于训练的源码 token,处理后数据体量约为 15.9 TB。此外,团队在制作过程中重做了去重流程,并修复了此前存在的去重 bug。据作者 @soldni 与 @giffmana 补充,旧版本管道中的 MinHash 分词器存在隐蔽缺陷(误用 \W 而非 \W+),导致 C++ 等代码特征中充斥空字符串,使得几乎所有高级语言都共享了相同的无效特征,该问题在 v3 中得到解决。

为什么重要

在当前 AI 发展阶段,强大的开源模型对社区至关重要。The Stack v3 为开发者提供了一个极其庞大的高质量代码训练基础,将直接推动开源代码模型及相关网络安全工具的研发进程。

2026-07-23 ~ 2026-07-24 · 13 条相关

一手来源

另有 6 条近重复转述:lvwerra · MeganRisdal · anton_lozhkov · soldni · JJitsev · anton_lozhkov