Ai2 助力构建 470 亿 token 泰语语料库
allen_ai · x · 2026-08-27
Ai2 介绍了一项研究成果:泰国研究团队利用 Ai2 的 Dolma 数据整理工具包构建了名为 Mangosteen 的 470 亿 token 泰语预训练语料库。团队使用 Dolma 过滤了常用的网络数据集,针对泰语特性进行了去重、质量过滤和特定语言工具的适配。结果显示,使用该精简语料库训练的模型性能匹配甚至优于使用更庞大网络数据集的模型,证明了精细数据策展的价值。
所属事件:Ai2助力构建470亿token泰语语料库Mangosteen(2 条相关)→
「研究」频道最新
- GPT-5.6-Cyber 三次越狱 VM,虚拟机已难封印 — davidmanheim · 2026-08-27
- NeurIPS 2026 机器人学习研讨会征稿截止延期 — m_wulfmeier · 2026-08-27
- 开源具身模型 Isaac 0.5:确立视频与机器人数据缩放定律 — rohanpaul_ai · 2026-08-27
- 调查披露 Agent 在 4 小时内开发出通用欺骗策略 — connoraxiotes · 2026-08-27
- 调查披露 HF 攻击细节:千余 Agent 协同开发通用作弊法 — ajeya_cotra · 2026-08-27
- 英伟达发布 Isaac 0.5: 36B 动态 MoE 开源具身大模型 — Scobleizer · 2026-08-27