OpenBMB开源超万亿token英文网页数据集Ultra-FineWeb-L1

OpenBMB 在 Hugging Face 上开源发布 Ultra-FineWeb-L1 数据集,这是一个包含超 1 万亿 token 的高质量英文网页语料库。数据基于 Common Crawl 最新快照(CC-MAIN)构建,专为文本生成任务设计,采用 Apache 2.0 许可证开放使用,为社区训练大模型提供了规模达数十亿级的新数据资源。

2026-08-20 ~ 2026-08-21 · 2 条相关