The Stack v3 becomes the largest open code dataset at 114 TB and 5T tokens

soldni · x · 2026-07-24

The Stack v3 has been released as the largest open code dataset so far: 114 TB, 770 languages, 224M repositories, and about 5T deduplicated and filtered source-code tokens.

What changed from v2

This is a major dataset-scale jump for open code pretraining and code research.

Related event: Hugging Face Releases The Stack v3: 114TB Largest Open Source Code Dataset(13 posts)→

Original post →

More from Research

Research channel →