Limite 从零预训:不足3000亿 token 几乎全喂数学,借鉴 nanogpt 竞速架构
tensorqt · x · 2026-09-22
Paradigm 公布其数学模型 Limite 的训练细节:完全从零预训练,语料不足 300B token,且几乎全部为数学数据;架构灵感来自 nanogpt speedrun 竞赛带来的最新进展。用极小数据量、极窄领域从零训练就达到高难数学能力,是这条信息的反差点。
「模型」频道最新
- 让两大前沿模型操纵真实机器人玩夺旗,Gemini 以 70% 胜率碾压对手 — chris_j_paxton · 2026-09-22
- Jev 推出 completions API:官方明确称别拿它做文本生成,只该用于分类打分 — AlexandrePesant · 2026-09-22
- 独立开发者发声:早在一年前就做出非自回归决策模型,称遭前沿实验室抢发 — HowDevelop · 2026-09-22
- 实测评测:105 个植入 bug 下 Grok 4.7 仅 28.7 分,不敌 GPT-6 — PawelHuryn · 2026-09-22
- 对 OpenAI GPT-5.6 发布页三个基准做回归,反推其 λ 取值 — tobyordoxford · 2026-09-22
- Paradigm 发布 Limite 1B:仅 300B token 从零训练出数学小模型 — tensorqt · 2026-09-22