Hugging Face 发布最大开源代码数据集 The Stack v3
Hugging Face 正式发布 The Stack v3,定位为下一代开源代码模型的训练基础。该数据集修复了此前的去重 bug,总计包含 114TB 原始数据,提取自 2240 万个代码仓库,覆盖超过 770 种编程语言,最终产出约 5 万亿 tokens 的语料。团队强调,在当前阶段构建强大的开源模型比以往任何时候都更加重要。
2026-07-23 ~ 2026-07-23 · 4 条相关
- The Stack v3 发布:114TB、2240 万仓库并修复去重 bug — anton_lozhkov · 2026-07-23
- The Stack v3 发布 5 万亿代码 token、覆盖 700 多种语言 — LoubnaBenAllal1 · 2026-07-23
- The Stack v3 上线:5T 训练 tokens 和 120TB 数据 — lvwerra · 2026-07-23
- Hugging Face 发布 The Stack v3:5 万亿 token 开源代码数据集 — lvwerra · 2026-07-23