OpenBMB 开源多套训练数据:代码 400B token、Agent 50 万样本
zibuyu9 · x · 2026-09-10
OpenBMB 围绕 MiniCPM5-2B 发布多套开源训练数据,覆盖代码、Agent 训练、RL 与大规模数据精炼:
- UltraX:以函数调用方式做数据精炼,把细粒度编辑变成可执行操作;开放预览含约 100B token、五个精炼后的网页数据集。
- UltraData-Code:L2 约 400B token、L3 约 150B token,覆盖 11 种编程语言。
- UltraData-SFT-Agent-2609:约 50 万条 Agent 训练样本,涵盖 Search、Code Agent、General Agent 与工具使用,任务包括网页搜索、软件工程、多轮记忆、数据库交互等。
- UltraData-RL-2609:8 万多条 RL 样本,覆盖数学、代码、知识与长上下文。
「研究」频道最新
- 开发者尝试用视频光流图训练扩散模型 — pixlpa · 2026-09-11
- 研究者的抱怨:拿万亿参数 LLM 当基线并不公平 — mariotelfig · 2026-09-11
- Play2Perfect 获 CoRL 2026 接收:先玩后精修,零样本迁移到真实装配 — leto__jean · 2026-09-11
- NVIDIA 三场 AI for Science 网络研讨会:蛋白质、气候与新材模拟 — AllThingsApx · 2026-09-11
- 传 OpenAI 接近验证 Hodge 猜想证明,千禧年难题再被 AI 破解 — TheGoldenLeaper · 2026-09-11
- SimWorld Studio:用进化式编码 Agent 自动生成具身训练环境 — ZhitingHu · 2026-09-11