OpenBMB 发布 Ultra-FineWeb-L1:1T+ 令牌英文预训练语料
AdinaYakup · x · 2026-08-21
OpenBMB 发布了 Ultra-FineWeb-L1,这是一个用于 LLM 预训练的超大规模高质量英文网络语料库。
- 规模:包含超过 1T (万亿) tokens,约 11.4 亿个文档。
- 数据源:基于 Common Crawl (CC-MAIN-2025-51)。
- 许可:采用 Apache 2.0 开源协议。
- 处理:使用 Trafilatura 2.0 进行高级清洗,并结合定制的质量检测机制以确保数据质量。
所属事件:OpenBMB 开源 1T+ token 高质量网页数据集(3 条相关)→
「研究」频道最新
- Hugging Face 探讨训练 AI 模型复现科研论文 — Hugging Face · 2026-08-21
- NeurIPS 2026 悉尼将办机器人世界模型工作坊,征文启动 — PontiEdoardo · 2026-08-21
- Cohere 讲座:从 Face ID 到猫检测的计算机视觉 — Cohere_Labs · 2026-08-21
- Smokebench:轻量级本地 LLM 基准测试 TUI 工具 — Ninja-5000 · 2026-08-21
- 超构表面+神经网络:红外多维成像新方法 — bravo_abad · 2026-08-21
- AI 时代的数学价值:Francis Su 教授致学生的信 — stevenstrogatz · 2026-08-21