IFM TxT360-v2 数据集登 HF 热榜,规模达 1B-10B 条
IFM · hf · 2026-09-08
IFM 的 TxT360-v2 数据集登上 Hugging Face 热门榜,是一个用于文本生成的万亿级以下规模(1B-10B)预训练数据集,以 parquet 格式发布,支持 dask、polars 等工具处理,采用 cc-by-4.0 许可证。
「研究」频道最新
- 77M 参数纯合成数据训练,Mitra-v2 登顶表格建模基准 — chaumian · 2026-09-08
- 索尼 AI 推出 Hakken 系统:从 150 万条假说中实证 2 项衰老基因新关系 — i_dg23 · 2026-09-08
- 从零搭建异步 RL 框架:JAX 多智能体训练实战工作日志 — yoshiyama_akira · 2026-09-08
- 用模型预判安全研究者的偏好:TASTE 评测基准登场 — burny_tech · 2026-09-08
- EMNLP 2026 论文:文本世界模型该比「行为一致」而非文本相似,假阳性率 42.5% 降至 9.5% — 机器之心 · 2026-09-08
- 港科大联合腾讯 ARC 发布 Track4World:前馈模型追踪全部像素 3D 轨迹 — rsasaki0109 · 2026-09-08