OpenBMB开源超万亿token英文网页数据集Ultra-FineWeb-L1
OpenBMB 在 Hugging Face 上开源发布 Ultra-FineWeb-L1 数据集,这是一个包含超 1 万亿 token 的高质量英文网页语料库。数据基于 Common Crawl 最新快照(CC-MAIN)构建,专为文本生成任务设计,采用 Apache 2.0 许可证开放使用,为社区训练大模型提供了规模达数十亿级的新数据资源。
2026-08-20 ~ 2026-08-21 · 2 条相关
- OpenBMB 发布 Ultra-FineWeb-L1 数据集,规模达数十亿级 — openbmb · 2026-08-20
- OpenBMB 开源 1T+ token 高质量网页数据集 Ultra-FineWeb-L1 — zibuyu9 · 2026-08-21