斯坦福开源 Marin 535B 训练数据整合全过程

斯坦福 Marin 团队成员 William Barr Held 发布长线程,揭秘 535B 模型的开源训练数据整合工程,讲解从 Hugging Face 下载数据到实际训练之间的全部工作。据 Percy Liang 介绍,该训练基于 25T tokens,全部来自 Hugging Face 上 152 个许可数据集,经过清洗整合而成,展现了大规模开源数据工程的完整流程。

2026-09-24 ~ 2026-09-24 · 2 条相关