TamilLM 完成 300 亿 token 预训练,loss 降到 2.84
sachinmaya1980 · x · 2026-07-27
TamilLM 已完成预训练,规模是 30 亿 tokens、57,221 步、15 亿参数。
- 训练大约消耗了 48 小时 H100,跨两个集群完成;团队估算全流程总成本约 2200 美元,包含故障和取证开销。
- 整体 held-out loss 从 4.61 降到 2.84。
- 最明显的提升出现在项目最想覆盖的“老派”泰米尔语登记体上:
- 古典 Sangam:6.08 → 3.50
- Bhakti devotional:6.66 → 3.67
- 文学散文:4.69 → 2.87
- 现代正式文体:4.52 → 2.69
- 团队表示所有 checkpoint 都做了完整性校验,并在 GPU 结束前保留了三份副本。
- 下一步是 post-training,让模型不只是“会续写泰米尔语”,而是更实用。
「模型」频道最新
- 多款前沿模型靠细致提示解出分布式系统难题 — _xjdr · 2026-07-27
- Claude Opus 5 只用一条提示词做出完整品牌 — FinanceYF5 · 2026-07-27
- Claude Opus 5 基准表展示多项智能体任务强势成绩 — FinanceYF5 · 2026-07-27
- Reddit 用户又在调侃 Gemini “挂了” — hebittoken · 2026-07-27
- 转发称:认真对待 Opus 3 本身就是一种超能力 — repligate · 2026-07-27
- 用户称 Gemini Pro 频繁报错且做不完 Workspace 任务 — CleanDifference6455 · 2026-07-27