Marin开源23万亿token预训练数据,可公开下载

joecole · x · 2026-08-22

斯坦福的Marin模型预训练数据现已公开,包含约23万亿token,可通过S3存储桶下载。该数据集的组成、架构、基础设施和内核细节均在GitHub上公开,训练过程可在wandb上实时观看。Marin团队表示,这次运行是数据、架构、基础设施和内核协同合作的成果。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →