Limite 从零预训:不足3000亿 token 几乎全喂数学,借鉴 nanogpt 竞速架构

tensorqt · x · 2026-09-22

Paradigm 公布其数学模型 Limite 的训练细节:完全从零预训练,语料不足 300B token,且几乎全部为数学数据;架构灵感来自 nanogpt speedrun 竞赛带来的最新进展。用极小数据量、极窄领域从零训练就达到高难数学能力,是这条信息的反差点。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →