OpenBMB 发布 Ultra-FineWeb-L1 数据集,规模达数十亿级
openbmb · hf · 2026-08-20
OpenBMB 在 Hugging Face 上发布了新数据集 Ultra-FineWeb-L1。该数据集专为文本生成任务设计,包含英语内容,采用 Apache 2.0 许可证。数据集规模在 1B 到 10B tokens 之间,主要面向 LLM 预训练与 Web 语料研究,相关论文编号为 arxiv:2505.05427 和 arxiv:2602.09003。
「研究」频道最新
- 利用时序多信号融合实现 Token 级幻觉检测 — Igor Itkin · 2026-08-20
- TRACES 发布:首个评测发现式 AI 的基准 — iamfakhrealam · 2026-08-20
- llama.cpp 深度调优:异构 GPU 提升 70% 生成速度与长文本实测 — fintip · 2026-08-20
- TMLR 综述:机器人基础模型的具身差距 — HirokatuKataoka · 2026-08-20
- 开源工具:CLI 一键将文档转为知识图谱 — tom_doerr · 2026-08-20
- IIT Bombay研究:最有礼貌的提示词最具操纵性 — alex_verem · 2026-08-20