基于 Dolma 构建 470 亿泰语词元,8B 模型超越 Llama
billhilf · x · 2026-08-27
泰国和新加坡的研究人员适配了 AllenAI 的 Dolma 数据管线,构建了名为 Mangosteen 的 470 亿词元泰语语料库。基于此持续预训练的 8B 模型在泰语基准测试中表现优于 Llama-3.1 8B。团队公开了管线、语料库和检查点,展示了开源 AI 生态如何赋能特定语言社区。
所属事件:Ai2 助力泰国团队构建 470 亿 token 泰语语料库(3 条相关)→
「模型」频道最新
- 新基准 PACT:一句施压让模型违规率升 65%,无一适合无人监督 — baseten · 2026-08-28
- 开源 Ornith-1.5-9B-OBLITERATED 模型发布 — BLUECOW009 · 2026-08-28
- 推理速度正在把工程师变成 agent 微管理员 — JiaZhihao · 2026-08-28
- 实测 3 个模型 20 类商品推荐:AI 的答案高度趋同 — deedydas · 2026-08-28
- 媒体聚焦 Anthropic 与 OpenAI,用户却涌向 Moonshot、DeepSeek 等中国模型 — CackleRooster · 2026-08-27
- 升级 Pro 套餐数小时后遭封号:OpenAI 误伤本地逆向开发爱好者 — BearBubbly9334 · 2026-08-27