Ai2 助力构建 470 亿 token 泰语语料库

allen_ai · x · 2026-08-27

Ai2 介绍了一项研究成果:泰国研究团队利用 Ai2 的 Dolma 数据整理工具包构建了名为 Mangosteen 的 470 亿 token 泰语预训练语料库。团队使用 Dolma 过滤了常用的网络数据集,针对泰语特性进行了去重、质量过滤和特定语言工具的适配。结果显示,使用该精简语料库训练的模型性能匹配甚至优于使用更庞大网络数据集的模型,证明了精细数据策展的价值。

所属事件:Ai2助力构建470亿token泰语语料库Mangosteen(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →